InfoSeek
Emerging17papers using it
2023first seen
InfoSeek is a benchmark dataset used to evaluate knowledge-based visual question answering (KB-VQA) systems by providing relevant external documents for conditioning answer generation.
Papers using InfoSeek (17)
- ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question AnsweringGround Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity IdentificationEnhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented GenerationRegion-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-RankingWikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question AnsweringLearning to Search: A Decision-Based Agent for Knowledge-Based Visual Question AnsweringWiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling CurriculumWhen RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMsMaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question AnsweringCC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question AnsweringReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question AnsweringKnowledge-based Visual Question Answer with Multimodal Processing, Retrieval and FilteringProgressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question AnsweringOMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal RetrievalCross-modal Retrieval for Knowledge-based Visual Question AnsweringCan Pre-trained Vision and Language Models Answer Visual
Information-Seeking Questions?EchoSight: Advancing Visual-Language Models with Wiki Knowledge