Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
comprehension
loadingβ¦
π€
Ask AI
Awesome comprehension β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
comprehension
24 papers tagged comprehension β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
24 papers Β· trending (default)
numbers = π₯ heat
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
(2026)
Qihua Dong et al.
1.72
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
(2025)
Miran Heo et al.
1.28
IndicMMLU-Pro: Benchmarking Indic Large Language Models on Multi-Task Language Understanding
(2025)
Sankalp KJ et al.
1.28
Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language Models
(2025)
Sonam Gupta et al.
1.28
HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs
(2025)
Tin Nguyen et al.
1.28
SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories
(2025)
Muzhi Zhu et al.
1.28
SmolVLM: Redefining small and efficient multimodal models
(2025)
AndrΓ©s Marafioti et al.
1.28
CoMemo: LVLMs Need Image Context with Image Memory
(2025)
Shi Liu et al.
1.28
VGR: Visual Grounded Reasoning
(2025)
Jiacong Wang et al.
1.28
ComoRAG: A Cognitive-Inspired Memory-Organized RAG for Stateful Long Narrative Reasoning
(2025)
Juyuan Wang et al.
1.28
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
(2025)
Yurun Chen et al.
1.28
MEMTRACK: Evaluating Long-Term Memory and State Tracking in Multi-Platform Dynamic Agent Environments
(2025)
Darshan Deshpande et al.
1.28
Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models
(2025)
Julianna Piskorz et al.
1.28
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
(2025)
Joona KytΓΆniemi et al.
1.28
Multimodal Web Navigation with Instruction-Finetuned Foundation Models
(2023)
Hiroki Furuta et al.
β
Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Cases
(2023)
Zhangyang Qi et al.
β
Needle In A Multimodal Haystack
(2024)
Weiyun Wang et al.
β
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
(2024)
Guangzhi Sun et al.
β
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
(2024)
Kirolos Ataallah et al.
β
Knowledge Mechanisms in Large Language Models: A Survey and Perspective
(2024)
Mengru Wang et al.
β
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
(2024)
Peng Xia et al.
β
SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAE
(2024)
Yongwei Chen et al.
β
VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding
(2024)
Kangsan Kim et al.
β
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
(2024)
Zhisheng Zhong et al.
β