Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
Visual
loadingβ¦
π€
Ask AI
Awesome Visual β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
Visual
24 papers tagged Visual β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
24 papers Β· trending (default)
numbers = π₯ heat
OCR-Agent: Agentic OCR with Capability and Memory Reflection
(2026)
Shimin Wen et al.
1.94
PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents
(2026)
Bihui Yu et al.
1.89
PlotGen: Multi-Agent LLM-based Scientific Data Visualization via Multimodal Feedback
(2025)
Kanika Goswami et al.
1.28
Introducing Visual Perception Token into Multimodal Large Language Model
(2025)
Runpeng Yu et al.
1.28
Visual-RFT: Visual Reinforcement Fine-Tuning
(2025)
Ziyu Liu et al.
1.28
When Words Outperform Vision: VLMs Can Self-Improve Via Text-Only Training For Human-Centered Decision Making
(2025)
Zhe Hu et al.
1.28
Visual Agentic Reinforcement Fine-Tuning
(2025)
Ziyu Liu et al.
1.28
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
(2025)
Zongzhao Li et al.
1.28
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
(2025)
Weihao Xuan et al.
1.28
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
(2025)
Junhao Cheng et al.
1.28
Play to Generalize: Learning to Reason Through Game Play
(2025)
Yunfei Xie et al.
1.28
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
(2025)
Weiyun Wang et al.
1.28
Visual Representation Alignment for Multimodal Large Language Models
(2025)
Heeji Yoon et al.
1.28
Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
(2025)
Lin Long et al.
1.28
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
(2025)
Sicheng Feng et al.
1.28
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
(2025)
Weijie Zhou et al.
1.28
V-Thinker: Interactive Thinking with Images
(2025)
Runqi Qiao et al.
1.28
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
(2025)
Chenhui Gou et al.
1.28
World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
(2025)
Eunsu Kim et al.
1.28
ORES: Open-vocabulary Responsible Visual Synthesis
(2023)
Minheng Ni et al.
β
Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Cases
(2023)
Zhangyang Qi et al.
β
Visual Haystacks: Answering Harder Questions About Sets of Images
(2024)
Tsung-Han Wu et al.
β
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
(2024)
Shehan Munasinghe et al.
β
NVILA: Efficient Frontier Visual Language Models
(2024)
Zhijian Liu et al.
β