AIME-24
Emerging42papers using it
2024first seen
AIME-24 is a benchmark dataset used to evaluate reinforcement learning with verifiable rewards (RLVR) in the context of solving challenging math questions.
Papers using AIME-24 (42)
- QuestA: Expanding Reasoning Capacity in LLMs via Question AugmentationSqueeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language ModelThinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient ReasonersSimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated ReasoningLearn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement LearningBeyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM ReasoningProcess Reward Models That ThinkCATPO: Critique-Augmented Tree Policy OptimizationUniform-Correct Policy Optimization: Breaking RLVR's Indifference to DiversityHTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective ControlFrom Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM ReasoningDeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement LearningMitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint AnnealingLearn Hard Problems During RL with Reference Guided Fine-tuningOff-Policy Value-Based Reinforcement Learning for Large Language ModelsSortedRL: Accelerating RL Training for LLMs through Online Length-Aware SchedulingASI-Evolve: AI Accelerates AIPrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical ReasoningInftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement LearningiGRPO: Self-Feedback-Driven LLM ReasoningLatent Poincar\'e Shaping for Agentic Reinforcement LearningLong Chain-of-Thought Compression via Fine-Grained Group Policy OptimizationPrioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language ModelsTransformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language ModelsCan LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM ReasoningGenerative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement LearningMasked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable RewardsGRPO-$\lambda$: Credit Assignment improves LLM ReasoningScaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM ReasoningTowards High Data Efficiency in Reinforcement Learning with Verifiable RewardDCPO: Dynamic Clipping Policy OptimizationEvolving Language Models without Labels: Majority Drives Selection, Novelty Promotes VariationSPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative RolloutsSIRI: Scaling Iterative Reinforcement Learning with Interleaved CompressionEnhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware InterventionPromoting Efficient Reasoning with Verifiable Stepwise RewardFirst Return, Entropy-Eliciting ExploreOn the Design of KL-Regularized Policy Gradient Algorithms for LLM ReasoningSkywork Open Reasoner 1 Technical ReportSRPO: A Cross-Domain Implementation of Large-Scale Reinforcement
Learning on LLMReinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn'tQwen2.5-Math Technical Report: Toward Mathematical Expert Model via
Self-Improvement