RewardBench
Emerging15papers using it
2024first seen
RewardBench is a benchmark dataset used to evaluate the performance of Generative Reward Models (GRMs) in reward modeling by providing a set of preference data for training and assessing pointwise reward predictions.
Papers using RewardBench (15)
- PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modelingreward-lens: A Mechanistic Interpretability Library for Reward ModelsIRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward ModelsMulti-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement LearningTiny Reward ModelsEfficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art PerformanceIntra-Trajectory Consistency for Reward ModelingAct-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective AmbiguitySentence-level Reward Model can Generalize Better for Aligning LLM from Human PreferenceInterpretable Preferences via Multi-Objective Reward Modeling and
Mixture-of-ExpertsRewardBench: Evaluating Reward Models for Language ModelingHelpSteer2: Open-source dataset for training top-performing reward
modelsPost-hoc Reward Calibration: A Case Study on Length BiasQuantile Regression for Distributional Reward Models in RLHFEvaluating Robustness of Reward Models for Mathematical Reasoning