JudgeBench
Emerging5papers using it
2025first seen
JudgeBench: A Benchmark for Evaluating LLM-Based Judges π [Paper] β’ π» [Github] β’ π€ [Dataset] β’ π [Leaderboard] JudgeBench is a benchmark aimed at evaluating LLM-based judges for objective correctness on challenging response pairs. For more information on how the response pairs are constructed, please see our paper.
Papers using JudgeBench (5)
- Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended TasksIRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward ModelsRLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable RewardsAct-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective AmbiguityLeveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating
LLM Judgments