TextVQA
Canonical20papers using it
1,682HF downloads
38HF likes
2020first seen
TextVQA requires models to read and reason about text in images to answer questions about them. Specifically, models need to incorporate a new modality of text present in the images and reason over it to answer TextVQA questions. TextVQA dataset contains 45,336 questions over 28,408 images from the OpenImages dataset.
π€ Hugging Faceβ cc-by-4.0
Papers using TextVQA (20)
- Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model EnsemblesVOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question AnsweringLinMU: Multimodal Understanding Made LinearText-VQA Aug: Pipelined Harnessing of Large Multimodal Models for Automated SynthesisFusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language ModelWhen Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMsFast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question AnsweringASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLMConstructive Distortion: Improving Mllms With Attention-guided Image WarpingInstruction-Aligned Visual Attention for Mitigating Hallucinations in
Large Vision-Language ModelsToward 3D Spatial Reasoning for Human-like Text-based Visual Question
AnsweringTAG: Boosting Text-VQA via Text-aware Visual Question-answer GenerationWinner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence ModelLaTr: Layout-Aware Transformer for Scene-Text VQASceneGATE: Scene-Graph based co-Attention networks for TExt visual
question answeringLocate Then Generate: Bridging Vision and Language with Bounding Box for
Scene-Text VQATowards a Unified Multimodal Reasoning FrameworkEnhancing Instruction-Following Capability of Visual-Language Models by
Reducing Image RedundancySpatially Aware Multimodal Transformers for TextVQAEKTVQA: Generalized use of External Knowledge to empower Scene Text in
Text-VQA