OCR
Emerging5papers using it
2025first seen
The 'OCR' dataset/benchmark contains tasks related to Optical Character Recognition and is used to evaluate the performance of Multimodal Large Language Models (MLLMs) in recognizing and interpreting text within images.
Papers using OCR (5)
- LoMo: Local Modality Substitution for Deeper Vision-Language FusionText-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMsInverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision MappingInvestigating Redundancy In Multimodal Large Language Models With Multiple Vision EncodersOptmerge: Unifying Multimodal LLM Capabilities And Modalities Via Model Merging