Vizwiz
Emerging9papers using it
2019first seen
The 'VizWiz' dataset is a benchmark used to evaluate vision-language models on their ability to understand and reason about complex visual scenes, particularly in the context of questions posed by visually impaired users.
Papers using Vizwiz (9)
- VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language ModelsHuman Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question AnsweringInverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision MappingFast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question AnsweringBelieving Without Seeing: Quality Scores For Contextualizing Vision-language Model ExplanationsHow to Configure Good In-Context Sequence for Visual Question AnsweringOpen-Ended Visual Question Answering by Multi-Modal Domain AdaptationLinear Alignment of Vision-language Models for Image CaptioningLeveraging Retrieval-Augmented Tags for Large Vision-Language
Understanding in Complex Scenes