← all papers · overview

R-align: Enhancing Generative Reward Models Through Rationale-centric Meta-judging

Abstract

Reinforcement Learning from Human Feedback (RLHF) remains indispensable for aligning large language models (LLMs) in subjective domains. To enhance robustness, recent work shifts toward Generative Reward Models (GenRMs) that generate rationales before predicting preferences. Yet in GenRM training and evaluation, practice remains outcome-label-only, leaving reasoning quality unchecked. We show that

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).