HealthBench
Emerging9papers using it
3,901HF downloads
161HF likes
2025first seen
Contains the data for the HealthBench eval. For the reference implementation of HealthBench, see OpenAI's simple-evals repo.
π€ Hugging Faceβ mit
Papers using HealthBench (9)
- Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended ReasoningBaichuan-M2: Scaling Medical Capability with Large Verifier SystemMitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement LearningImproving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPOAlternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization StrategyRubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine GenerationMultidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference ConstraintsDoctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement LearningRubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains