VQA-Rad
Emerging26papers using it
2021first seen
Dataset Card for VQA-RAD Dataset Description VQA-RAD is a dataset of question-answer pairs on radiology images. The dataset is intended to be used for training and testing Medical Visual Question Answering (VQA) systems. The dataset includes both open-ended questions and binary "yes/no" questions. The dataset is built
Papers using VQA-Rad (26)
- Capabilities Of GPT-5 On Multimodal Medical ReasoningScalable Training of Spatially Grounded 2D Vision-Language Models for RadiologyBenchmarking GPT-5 For Zero-shot Multimodal Medical Reasoning In Radiology And Radiation OncologyA Benchmark for Hallucination Detection in VLMs for Gastrointestinal EndoscopyBenchmarking The Thinking Mode Of Multimodal Large Language Models In Clinical TasksWasserstein Equilibrium Decoding for Reliable Medical Visual Question AnsweringDual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQAInViC: Intent-aware Visual Cues for Medical Visual Question AnsweringVGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMsRobust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked ReconstructionDecoupling Vision and Language: Codebook Anchored Visual AdaptationCMI-MTL: Cross-Mamba interaction based multi-task learning for medical visual question answeringHEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language ModelsLlada-medv: Exploring Large Language Diffusion Models For Biomedical Image UnderstandingHow Far Have Medical Vision-language Models Come? A Comprehensive Benchmarking StudyMedvqa-tree: A Multimodal Reasoning And Retrieval Framework For Sarcopenia PredictionTest-time Warmup For Multimodal Large Language ModelsQ-FSRU: Quantum-augmented Frequency-spectral Fusion For Medical Visual Question AnsweringMuVAM: A Multi-View Attention-based Model for Medical Visual Question
AnsweringMedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for MedicineRAMM: Retrieval-augmented Biomedical Visual Question Answering with
Multi-modal Pre-trainingMedThink: Explaining Medical Visual Question Answering via Multimodal
Decision-Making RationaleMulti-modal Understanding and Generation for Medical Images and Text via Vision-Language Pre-TrainingLaPA: Latent Prompt Assist Model For Medical Visual Question AnsweringFusion of Domain-Adapted Vision and Language Models for Medical Visual
Question AnsweringMMBERT: Multimodal BERT Pretraining for Improved Medical VQA