OK-VQA
Canonical34papers using it
2021first seen
OK-VQA is a new dataset for visual question answering that requires methods which can draw upon outside knowledge to answer questions. - 14,055 open-ended questions - 5 ground truth answers per question - Manually filtered to ensure all questions require outside knowledge (e.g. from Wikipeida) - Reduced questions with
Papers using OK-VQA (34)
- Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context LearningFRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question AnsweringEnhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented GenerationHierarchical Pre-Training of Vision Encoders with Large Language ModelsWhen RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMsCC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question AnsweringFrom Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question AnsweringExplanation-driven Counterfactual Testing For Faithfulness In Vision-language Model ExplanationsProgressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question AnsweringWhen Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMsMV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question AnsweringSee the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question AnsweringCross Domain Evaluation Of Multimodal Chain-of-thought Reasoning Of Different Datasets Into The Amazon Cot FrameworkFilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQAMuKEA: Multimodal Knowledge Extraction and Accumulation for
Knowledge-based Visual Question AnsweringREVIVE: Regional Visual Representation Matters in Knowledge-Based Visual
Question AnsweringMixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource
Visual Question AnsweringA Symmetric Dual Encoding Dense Retrieval Framework for
Knowledge-Intensive Visual Question AnsweringMulti-Modal Answer Validation for Knowledge-Based VQAGenerate then Select: Open-ended Visual Question Answering Guided by
World KnowledgeFine-grained Late-interaction Multi-modal Retrieval for Retrieval
Augmented Visual Question AnsweringSecuring Vision-Language Models with a Robust Encoder Against Jailbreak
and Adversarial AttacksHow to Configure Good In-Context Sequence for Visual Question AnsweringReasoning over Vision and Language: Exploring the Benefits of
Supplemental KnowledgeUncertainty-based Visual Question Answering: Estimating Semantic
Inconsistency between Image and Knowledge BaseVLIS: Unimodal Language Models Guide Multimodal Language GenerationKnowledge Condensation and Reasoning for Knowledge-based VQAImproving and Diagnosing Knowledge-Based Visual Question Answering via
Entity Enhanced Knowledge InjectionLaKo: Knowledge-driven Visual Question Answering via Late
Knowledge-to-Text InjectionLearning to Compress Contexts for Efficient Knowledge-based Visual
Question AnsweringImage Captioning for Effective Use of Language Models in Knowledge-Based
Visual Question AnsweringA Simple Baseline for Knowledge-Based Visual Question AnsweringText as Images: Can Multimodal Large Language Models Follow Printed
Instructions in Pixels?Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question
Answering