Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
human-annotated
loadingβ¦
π€
Ask AI
Awesome human-annotated β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
human-annotated
11 papers tagged human-annotated β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
11 papers Β· trending (default)
numbers = π₯ heat
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
(2026)
Yinghao Ma et al.
1.94
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
(2026)
Han Wang et al.
1.94
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
(2026)
Xiangbo Gao et al.
1.94
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
(2025)
Jing Bi et al.
1.28
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
(2025)
Yufei Zhan et al.
1.28
Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research Agents
(2025)
Rui Wang et al.
1.28
DOCCI: Descriptions of Connected and Contrasting Images
(2024)
Yasumasa Onoe et al.
β
SePPO: Semi-Policy Preference Optimization for Diffusion Alignment
(2024)
Daoan Zhang et al.
β
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
(2024)
Peng Xia et al.
β
Cross-Lingual Auto Evaluation for Assessing Multilingual LLMs
(2024)
Sumanth Doddapaneni et al.
β
GATE OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
(2024)
Pengfei Zhou et al.
β