CLEVR
Emerging12papers using it
2018first seen
CLEVR is a dataset designed to evaluate the ability of models to perform visual reasoning and understand complex relationships in images through a series of structured questions and answers.
Papers using CLEVR (12)
- Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate RepresentationsSelf-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual ReasoningUnderstand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal ModelsThink or Not? Selective Reasoning via Reinforcement Learning for Vision-Language ModelsVisual Entailment: A Novel Task for Fine-Grained Image UnderstandingMDETR -- Modulated Detection for End-to-End Multi-Modal UnderstandingCascaded Mutual Modulation for Visual ReasoningCLEVR_HYP: A Challenge Dataset and Baselines for Visual Question
Answering with Hypothetical Actions over ImagesVITR: Augmenting Vision Transformers with Relation-Focused Learning for
Cross-Modal Information RetrievalLCV2: An Efficient Pretraining-Free Framework for Grounded Visual
Question AnsweringSADL: An Effective In-Context Learning Method for Compositional Visual
QAObject-based reasoning in VQA