Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
evaluator
loadingβ¦
π€
Ask AI
Awesome evaluator β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
evaluator
5 papers tagged evaluator β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
5 papers Β· trending (default)
numbers = π₯ heat
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
(2026)
Haoxiang Jiang et al.
1.94
SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations
(2026)
Taewon Yun et al.
1.94
Advancing Reference-free Evaluation of Video Captions with Factual Analysis
(2025)
Shubhashis Roy Dipta et al.
1.28
EvoSyn: Generalizable Evolutionary Data Synthesis for Verifiable Learning
(2025)
He Du et al.
1.28
Cross-Lingual Auto Evaluation for Assessing Multilingual LLMs
(2024)
Sumanth Doddapaneni et al.
β