GSM8K
Emerging65papers using it
2024first seen
GSM-8K is a benchmark dataset that contains problems requiring single-step reasoning, used to evaluate the performance of large language model agents in decision-making tasks.
Papers using GSM8K (65)
- Stable Reinforcement Learning for Efficient ReasoningThink or Not? Selective Reasoning via Reinforcement Learning for Vision-Language ModelsReasoning Under 1 Billion: Memory-Augmented Reinforcement Learning for
Large Language ModelsRUMAD: Reinforcement-Unifying Multi-Agent DebateQeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMsOpen-Medical-R1: How to Choose Data for RLVR Training at Medicine DomainWeight-Space Geometry of Offline Reasoning TrainingMOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMsEnhancing Multi-Step Reasoning Abilities of Language Models through
Direct Q-Function OptimizationDiscrete Tilt MatchingGroup-Aware Reinforcement Learning for Output Diversity in Large Language ModelsBoosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical ReasoningEntropy-Regularized Process Reward ModelSLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory SlicingSelective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language ModelsGradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix WorksRubric-Grounded RL: Structured Judge Rewards for Generalizable ReasoningStructured Recurrent Mixers for Massively Parallelized Sequence GenerationLEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement LearningPopuLoRA: Co-Evolving LLM Populations for Reasoning Self-PlayLearning-Zone Energy: Online Data Selection for Efficient RL Post-TrainingPost-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy DistillationQuantifying Empirical Compute-Supervision Tradeoffs in RLVRDon't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM AgentsESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-TuningThink Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient ReasoningTMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFTBeyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning$n$-Musketeers: Reinforcement Learning Shapes Collaboration Among Language ModelsUpSkill: Mutual Information Skill Learning for Structured Response Diversity in LLMsAGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model TrainingSD-E$^2$: Semantic Exploration for Reasoning Under Token BudgetsWhy GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive GradientsSemantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement LearningDifferentiable Evolutionary Reinforcement LearningScRPO: From Errors to InsightsThe Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models TrainingLearning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement LearningReward Model Routing in Alignmenth1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement LearningGIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNAMASPRM: Multi-Agent System Process Reward ModelInpainting-Guided Policy Optimization for Diffusion Large Language ModelsIt's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RLwd1: Weighted Policy Optimization for Reasoning in Diffusion Language ModelsEfficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art PerformanceLearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient AlignmentRL for Reasoning by Adaptively Revealing RationalesTutorGym: A Testbed for Evaluating AI Agents as Tutors and StudentsRL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMsMaximizing Confidence Alone Improves ReasoningSegment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language ModelsSynthetic Data RL: Task Definition Is All You NeedSynthetic Data Generation & Multi-Step RL for Reasoning & Tool UseTraining Large Language Models to Reason via EM Policy GradientTowards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language ModelsTapered Off-Policy REINFORCE: Stable and efficient reinforcement
learning for LLMsBig-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement
Learning in Language ModelsCoevolving with the Other You: Fine-Tuning LLM with Sequential
Cooperative Multi-Agent Reinforcement LearningQwen2.5-Math Technical Report: Toward Mathematical Expert Model via
Self-ImprovementVinePPO: Refining Credit Assignment in RL Training of LLMsOffline Reinforcement Learning for LLM Multi-Step ReasoningCPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning
TasksSMART: Self-learning Meta-strategy Agent for Reasoning TasksAsynchronous RLHF: Faster and More Efficient Off-Policy RL for Language
Models