MATH-500
Emerging61papers using it
168,210HF downloads
318HF likes
2025first seen
Dataset Card for MATH-500 This dataset contains a subset of 500 problems from the MATH benchmark that OpenAI created in their Let's Verify Step by Step paper. See their GitHub repo for the source file: https://github.com/openai/prm800k/tree/main?tab=readme-ov-file#math-splits
Papers using MATH-500 (61)
- Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data ContaminationStable Reinforcement Learning for Efficient ReasoningNemotron-CrossThink: Scaling Self-Learning beyond Math ReasoningSqueeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language ModelKimi k1.5: Scaling Reinforcement Learning with LLMsQeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMsHow Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVRRL with Learnable Textual Feedback: A Bilevel ApproachMOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMsReinforcement Learning for Reasoning in Large Language Models with One Training ExampleDiscrete Tilt MatchingR$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM ReasoningDianJin-R1: Evaluating and Enhancing Financial Reasoning in Large
Language ModelsProcess Reward Models That ThinkOpen-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base ModelSLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory SlicingCATPO: Critique-Augmented Tree Policy OptimizationMaximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement LearningGradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix WorksPopuLoRA: Co-Evolving LLM Populations for Reasoning Self-PlayHow Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM ReasoningESPO: Early-Stopping Proximal Policy OptimizationReasoning with Sampling: Cutting at Decision PointsLLM Reasoning with Process Rewards for Outcome-Guided StepsPerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward AlignmentSampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte CarloTool Verification for Test-Time Reinforcement LearningSortedRL: Accelerating RL Training for LLMs through Online Length-Aware SchedulingThink Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient ReasoningPrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical ReasoningBoosting LLM Reasoning via Human-Inspired Reward ShapingBeyond Correctness: Learning Robust Reasoning via TransferLatent Poincar\'e Shaping for Agentic Reinforcement LearningLong Chain-of-Thought Compression via Fine-Grained Group Policy OptimizationPrioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language ModelsAmortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language ModelsPRPO: Aligning Process Reward with Outcome Reward in Policy OptimizationTraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM ReasoningCan LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM ReasoningScRPO: From Errors to InsightsMasked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable RewardsGRPO-$\lambda$: Credit Assignment improves LLM Reasoningh1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement LearningMATH-Beyond: A Benchmark for RL to Expand Beyond the Base ModelReasoning with Sampling: Your Base Model is Smarter Than You ThinkInpainting-Guided Policy Optimization for Diffusion Large Language ModelsSPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative RolloutsFrom Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process SupervisionEnhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Interventionwd1: Weighted Policy Optimization for Reasoning in Diffusion Language ModelsConfidence Is All You Need: Few-Shot RL Fine-Tuning of Language ModelsSpurious Rewards: Rethinking Training Signals in RLVR$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative DraftsNot All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement LearningMaximizing Confidence Alone Improves ReasoningOptimal Policy Minimum Bayesian RiskSPC: Evolving Self-Play Critic via Adversarial Games for LLM ReasoningTowards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language ModelsControlling Large Language Model with Latent ActionsOn the Emergence of Thinking in LLMs I: Searching for the Right
IntuitionExploring the Limit of Outcome Reward for Learning Mathematical
Reasoning