VQA
Canonical90papers using it
2016first seen
Visual Question Answering — open-ended questions about images requiring joint vision and language understanding.
Papers using VQA (89)
- Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual EvidenceMultimodal Integration of Human-Like Attention in Visual Question AnsweringHyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context LearningVisual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image AnalysisLatent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language ModelsFRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question AnsweringInvestigating Adversarial Robustness of Multi-modal Large Language ModelsLoMo: Local Modality Substitution for Deeper Vision-Language FusionEnsemHalDet: Robust VLM Hallucination Detection via Ensemble of Internal State DetectorsAIM: Asymmetric Information Masking for Visual Question Answering Continual LearningDOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf ModelsRS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images UnderstandingInstruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language ReasoningDEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language ModelsLLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language ModelsParallel In-context Learning for Large Vision Language ModelsHidden Clones: Exposing and Fixing Family Bias in Vision-Language Model EnsemblesN\"uwa: Mending the Spatial Integrity Torn by VLM Token PruningVOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question AnsweringGuardAlign: Test-time Safety Alignment in Multimodal Large Language ModelsText-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMsHybridToken-VLM: Hybrid Token Compression for Vision-Language ModelsEfficient Vision-Language Reasoning via Adaptive Token PruningOMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language ModelsDraft and Refine with Visual ExpertsLooking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language ModellingHuman Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question AnsweringV-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language ModelsAttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention AnchorsMV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question AnsweringINTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance SamplingInvestigating Redundancy In Multimodal Large Language Models With Multiple Vision EncodersPostAlign: Multimodal Grounding as a Corrective Lens for MLLMsCalibrating Uncertainty Quantification of Multi-Modal LLMs using
GroundingVISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information MaximizationOptmerge: Unifying Multimodal LLM Capabilities And Modalities Via Model MergingElevating Visual Question Answering through Implicitly Learned Reasoning
Pathways in LVLMsSemantic-Clipping: Efficient Vision-Language Modeling with
Semantic-Guidedd Visual SelectionAsk and Remember: A Questions-Only Replay Strategy for Continual Visual Question AnsweringUniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language UnderstandingVisualBERT: A Simple and Performant Baseline for Vision and LanguageBLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image
Encoders and Large Language ModelsSimVLM: Simple Visual Language Model Pretraining with Weak SupervisionVLMo: Unified Vision-Language Pre-Training with
Mixture-of-Modality-ExpertsLXMERT: Learning Cross-Modality Encoder Representations from
TransformersHadamard Product for Low-rank Bilinear PoolingImage as a Foreign Language: BEiT Pretraining for All Vision and
Vision-Language TasksMulti-modal Factorized Bilinear Pooling with Co-Attention Learning for
Visual Question AnsweringDeep Modular Co-Attention Networks for Visual Question AnsweringGenerating Question Relevant Captions to Aid Visual Question AnsweringMultimodal Unified Attention Networks for Vision-and-Language
InteractionsMMBench: Is Your Multi-modal Model an All-around Player?MixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource
Visual Question AnsweringCo-attending Free-form Regions and Detections with Multi-modal
Multiplicative Feature Embedding for Visual Question AnsweringMGA-VQA: Multi-Granularity Alignment for Visual Question AnsweringReciprocal Attention Fusion for Visual Question AnsweringMultimodal Graph Transformer for Multimodal Question AnsweringPlug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models
with Zero TrainingAnswer Questions with Right Image Regions: A Visual Attention
Regularization ApproachEnabling Multimodal Generation on CLIP via Vision-Language Knowledge
DistillationBridgeTower: Building Bridges Between Encoders in Vision-Language
Representation LearningHow to Configure Good In-Context Sequence for Visual Question AnsweringImproved Fusion of Visual and Language Representations by Dense
Symmetric Co-Attention for Visual Question AnsweringMitigating Dialogue Hallucination for Large Vision Language Models via
Adversarial Instruction TuningVisual Question Answering based on Local-Scene-Aware Referring
Expression GenerationUnsupervised Vision-and-Language Pre-training via Retrieval-based
Multi-Granular AlignmentGeneralization Differences between End-to-End and Neuro-Symbolic
Vision-Language Reasoning SystemsUsing Visual Cropping to Enhance Fine-Detail Question Answering of
BLIP-Family ModelsLXMERT Model Compression for Visual Question AnsweringBarlow constrained optimization for Visual Question AnsweringEfficientVLM: Fast and Accurate Vision-Language Models via Knowledge
Distillation and Modal-adaptive PruningTraining Vision-Language Models with Less Bimodal SupervisioneP-ALM: Efficient Perceptual Augmentation of Language ModelsMaking the Most of What You Have: Adapting Pre-trained Visual Language
Models in the Low-data RegimeGenerative Visual Question AnsweringTowards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language
ModelsTowards Perceiving Small Visual Details in Zero-shot Visual Question
Answering with Multimodal LLMsImproving Vision-and-Language Reasoning via Spatial Relations ModelingVQAttack: Transferable Adversarial Attacks on Visual Question Answering
via Pre-trained ModelsMulti-Modal Hallucination Control by Visual Information GroundingSelectively Answering Visual QuestionsEnhancing Instruction-Following Capability of Visual-Language Models by
Reducing Image RedundancyMAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at ScaleOptimizing Vision-Language Interactions Through Decoder-Only ModelsLeveraging Retrieval-Augmented Tags for Large Vision-Language
Understanding in Complex ScenesQuestion-Agnostic Attention for Visual Question AnsweringLinguistically-aware Attention for Reducing the Semantic-Gap in
Vision-Language TasksAn Improved Attention for Visual Question Answering