MATH
Emerging45papers using it
2024first seen
The 'MATH' dataset is a benchmark used to evaluate the mathematical reasoning capabilities of models.
Papers using MATH (45)
- Complementing reinforcement learning with SFT through logit averaging in the post training of LLMsEnhancing Multi-Step Reasoning Abilities of Language Models through
Direct Q-Function OptimizationGroup-Aware Reinforcement Learning for Output Diversity in Large Language ModelsWarm Up Before You Train: Unlocking General Reasoning in Resource-Constrained SettingsEntropy-Regularized Process Reward ModelARCA: Adapter-Residual Credit Assignment When Token Signals DegenerateCATPO: Critique-Augmented Tree Policy OptimizationRubric-Grounded RL: Structured Judge Rewards for Generalizable ReasoningDUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable RewardsVerifier-Free RL for LLMs via Intrinsic Gradient-Norm RewardBeyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-TrainingVSPO: Vector-Steered Policy Optimization for Behavioral ControlLearning-Zone Energy: Online Data Selection for Efficient RL Post-TrainingLearning Adaptive LLM DecodingDiscovering Process-Outcome Credit in Multi-Step LLM ReasoningTMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFTEntropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language ModelsTRE: Encouraging Exploration in the Trust RegionETR: Outcome-Guided Elastic Trust Regions for Policy OptimizationWhy GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive GradientsDifferentiable Evolutionary Reinforcement LearningPrompt Curriculum Learning for Efficient LLM Post-TrainingPlan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM ReasoningDon't Waste Mistakes: Leveraging Negative RL-Groups via Confidence ReweightingPinpointing crucial steps: Attribution-based Credit Assignment for Verifiable Reinforcement LearningGIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNAMASPRM: Multi-Agent System Process Reward ModelKnow When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement LearningIt's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RLWirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement LearningRL for Reasoning by Adaptively Revealing RationalesTutorGym: A Testbed for Evaluating AI Agents as Tutors and StudentsPutting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With VerifiersRL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement LearningMining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N SamplingSynthetic Data RL: Task Definition Is All You NeedConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning ModelsTapered Off-Policy REINFORCE: Stable and efficient reinforcement
learning for LLMsBig-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement
Learning in Language ModelsQwen2.5-Math Technical Report: Toward Mathematical Expert Model via
Self-ImprovementOpenR: An Open Source Framework for Advanced Reasoning with Large
Language ModelsVinePPO: Refining Credit Assignment in RL Training of LLMsFree Process Rewards without Process LabelsOffline Reinforcement Learning for LLM Multi-Step ReasoningCPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning
Tasks