Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
tests
loadingβ¦
π€
Ask AI
Awesome tests β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
tests
7 papers tagged tests β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
7 papers Β· trending (default)
numbers = π₯ heat
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
(2026)
Jie Yang et al.
1.94
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
(2026)
Bingchen Zhao et al.
1.94
GitChameleon: Evaluating AI Code Generation Against Python Library Version Incompatibilities
(2025)
Diganta Misra et al.
1.28
MovieCORE: COgnitive REasoning in Movies
(2025)
Gueter Josmy Faure et al.
1.28
Three Bricks to Consolidate Watermarks for Large Language Models
(2023)
Pierre Fernandez et al.
β
Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code
(2024)
Hyungjoo Chae et al.
β
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
(2024)
Adhiraj Ghosh et al.
β