Visual Question Answering (VQA)
Emerging17papers using it
2019first seen
Visual Question Answering (VQA) is a benchmark that evaluates the ability of models to answer questions about images, integrating visual and textual understanding.
Papers using Visual Question Answering (VQA) (17)
- Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene UnderstandingCross-Modal Attention Guided Unlearning in Vision-Language ModelsDo LVLMs Know What They Know? A Systematic Study of Knowledge Boundary Perception in LVLMsProvoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context LearningTowards Resource-efficient Multimodal Intelligence: Learned Routing Among Specialized Expert ModelsDo Large Vision-language Models Distinguish Between The Actual And Apparent Features Of Illusions?Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into
Multimodal LLMsLarge-Scale Adversarial Training for Vision-and-Language Representation
LearningHow Much Can CLIP Benefit Vision-and-Language Tasks?Cross-Modality Relevance for Reasoning on Language and VisionCLIP-TD: CLIP Targeted Distillation for Vision-Language TasksLarge Language Models are Visual Reasoning CoordinatorsMultimodal Adaptive Distillation for Leveraging Unimodal Encoders for
Vision-Language TasksUncertainty-Aware Evaluation for Vision-Language ModelsLarge-scale Pretraining for Visual Dialog: A Simple State-of-the-Art
BaselineCAVL: Learning Contrastive and Adaptive Representations of Vision and
LanguageBoth Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM