Awesome AI for Code
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
benchmarks
loadingβ¦
π€
Ask AI
Awesome benchmarks β curated papers, datasets & benchmarks Β· Awesome AI for Code
β all topics
overview
benchmarks
15 papers tagged benchmarks β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
15 papers Β· trending (default)
numbers = π₯ heat
GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
(2025)
GLM-4. 5 Team et al.
5.10
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
(2025)
Xu Huang et al.
2.87
WiCkeD: A Simple Method to Make Multiple Choice Benchmarks More Challenging
(2025)
Ahmed Elhady et al.
2.87
NGM: A Plug-and-Play Training-Free Memory Module for LLMs
(2026)
Yuwen Qu et al.
1.94
FastKernels: Benchmarking GPU Kernel Generation in Production
(2026)
Gabriele Oliaro et al.
1.94
Visual Programmability: A Guide for Code-as-Thought in Chart Understanding
(2025)
Bohao Tang et al.
1.28
Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
(2025)
Yueqi Song et al.
1.28
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
(2025)
Tianyu Fu et al.
1.22
Large-Scale Data Selection for Instruction Tuning
(2025)
Hamish Ivison et al.
1.11
Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts
(2024)
Tong Zhu et al.
β
Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep Learning
(2024)
Wei An et al.
β
Lemur: Harmonizing Natural Language and Code for Language Agents
(2023)
Yiheng Xu et al.
β
CodecLM: Aligning Language Models with Tailored Synthetic Data
(2024)
Zifeng Wang et al.
β
OpenDevin: An Open Platform for AI Software Developers as Generalist Agents
(2024)
Xingyao Wang et al.
β
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
(2024)
Zihan Liu et al.
β