GQA
Canonical42papers using it
2019first seen
A compositional visual-question-answering benchmark generated from Visual Genome scene graphs.
Papers using GQA (42)
- Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination MitigationHierarchical Pre-Training of Vision Encoders with Large Language ModelsAIM: Asymmetric Information Masking for Visual Question Answering Continual LearningHidden Clones: Exposing and Fixing Family Bias in Vision-Language Model EnsemblesVOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question AnsweringHow Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal ReasoningText-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMsHybridToken-VLM: Hybrid Token Compression for Vision-Language ModelsEfficient Vision-Language Reasoning via Adaptive Token PruningMV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question AnsweringMPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language ModelsHierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust GroundingByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free WayASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLMConstructive Distortion: Improving Mllms With Attention-guided Image WarpingTest-time Warmup For Multimodal Large Language ModelsMulti-Sourced Compositional Generalization in Visual Question AnsweringLXMERT: Learning Cross-Modality Encoder Representations from
TransformersMixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource
Visual Question AnsweringWeakly Supervised Relative Spatial Reasoning for Visual Question
AnsweringAnswer-Me: Multi-Task Open-Vocabulary Visual Question AnsweringMGA-VQA: Multi-Granularity Alignment for Visual Question AnsweringMultimodal Graph Transformer for Multimodal Question AnsweringPlug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models
with Zero TrainingDeclaration-based Prompt Tuning for Visual Question AnsweringREXUP: I REason, I EXtract, I UPdate with Structured Compositional
Reasoning for Visual Question AnsweringEfficient Large Multi-modal Models via Visual Context CompressionWeakly Supervised Grounding for VQA in Vision-Language TransformersMDETR -- Modulated Detection for End-to-End Multi-Modal UnderstandingCompound Tokens: Channel Fusion for Vision-Language Representation
LearningCurriculum Learning for Compositional Visual ReasoningAttention Guided Semantic Relationship Parsing for Visual Question
AnsweringGeneralization Differences between End-to-End and Neuro-Symbolic
Vision-Language Reasoning SystemsII-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in
Visual Question AnsweringxGQA: Cross-Lingual Visual Question AnsweringTraining Vision-Language Models with Less Bimodal SupervisionModular Visual Question Answering via Code GenerationTowards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language
ModelsLCV2: An Efficient Pretraining-Free Framework for Grounded Visual
Question AnsweringSADL: An Effective In-Context Learning Method for Compositional Visual
QAEnhancing Instruction-Following Capability of Visual-Language Models by
Reducing Image RedundancyLeveraging Retrieval-Augmented Tags for Large Vision-Language
Understanding in Complex Scenes