VQA v-2
Emerging20papers using it
2017first seen
VQA-2.0 is a benchmark dataset that contains images paired with questions and answers, used to evaluate the performance of models in visual question answering tasks.
Papers using VQA v-2 (20)
- Analyzing the Sensitivity of Vision Language Models in Visual Question AnsweringBilinear Attention NetworksUnified Vision-Language Pre-Training for Image Captioning and VQAExploring Human-like Attention Supervision in Visual Question AnsweringMUREL: Multimodal Relational Reasoning for Visual Question AnsweringDynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual
Question AnsweringAnswer-Me: Multi-Task Open-Vocabulary Visual Question AnsweringCompact Trilinear Interaction for Visual Question AnsweringSurvey of Recent Advances in Visual Question AnsweringLeveraging Visual Question Answering to Improve Text-to-Image SynthesisDual Recurrent Attention Units for Visual Question AnsweringImproved Fusion of Visual and Language Representations by Dense
Symmetric Co-Attention for Visual Question AnsweringMixGen: A New Multi-Modal Data AugmentationCompound Tokens: Channel Fusion for Vision-Language Representation
LearningAnswer-checking in Context: A Multi-modal FullyAttention Network for
Visual Question AnsweringEnhancing Visual Question Answering through Ranking-Based Hybrid
Training and Multimodal FusionOpen-Ended Visual Question Answering by Multi-Modal Domain AdaptationImage Captioning for Effective Use of Language Models in Knowledge-Based
Visual Question AnsweringVQA with Cascade of Self- and Co-Attention BlocksCycle-Consistency for Robust Visual Question Answering