Awesome AI for Code
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
evaluation
loadingβ¦
π€
Ask AI
Awesome evaluation β curated papers, datasets & benchmarks Β· Awesome AI for Code
β all topics
overview
evaluation
13 papers tagged evaluation β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
13 papers Β· trending (default)
numbers = π₯ heat
EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems
(2026)
Kenneth Benavides et al.
4.39
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
(2025)
Xu Huang et al.
2.87
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
(2026)
Ruchit Rawal et al.
2.00
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
(2026)
Tongkun Guan et al.
1.94
An Empirical Study of Automating Agent Evaluation
(2026)
Kang Zhou et al.
1.94
RExBench: Can coding agents autonomously implement AI research extensions?
(2025)
Nicholas Edwards et al.
1.28
Technical Report: Full-Stack Fine-Tuning for the Q Programming Language
(2025)
Brendan R. Hogan et al.
1.28
G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment
(2023)
Yang Liu et al.
β
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
(2023)
Seonghyeon Ye et al.
β
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
(2024)
Joongwon Kim et al.
β
OpenDevin: An Open Platform for AI Software Developers as Generalist Agents
(2024)
Xingyao Wang et al.
β
Cross-Lingual Auto Evaluation for Assessing Multilingual LLMs
(2024)
Sumanth Doddapaneni et al.
β
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
(2024)
Zihan Liu et al.
β