Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
Benchmark
loadingβ¦
π€
Ask AI
Awesome Benchmark β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
Benchmark
10 papers tagged Benchmark β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
10 papers Β· trending (default)
numbers = π₯ heat
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
(2025)
Haonan Chen et al.
1.28
Plutus: Benchmarking Large Language Models in Low-Resource Greek Finance
(2025)
Xueqing Peng et al.
1.28
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
(2025)
Muzhi Zhu et al.
1.28
JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
(2025)
Atsuyuki Miyai et al.
1.28
JARVIS-1: Open-World Multi-task Agents with Memory-Augmented Multimodal Language Models
(2023)
Zihao Wang et al.
β
Generative Representational Instruction Tuning
(2024)
Niklas Muennighoff et al.
β
CRAG -- Comprehensive RAG Benchmark
(2024)
Xiao Yang et al.
β
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
(2024)
Zuxin Liu et al.
β
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
(2024)
Haoran Que et al.
β
TOMG-Bench: Evaluating LLMs on Text-based Open Molecule Generation
(2024)
Jiatong Li et al.
β