AIME
Emerging33papers using it
171HF downloads
0HF likes
2025first seen
The AIME dataset/benchmark contains mathematical reasoning tasks used to evaluate the performance of large language models in generating correct solutions and intermediate reasoning steps.
Papers using AIME (33)
- Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data ContaminationCDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language ModelsKimi k1.5: Scaling Reinforcement Learning with LLMsRing-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMsDon't Let Gains FADE: Breaking Down Policy Gradient Weights in RLLogic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement
LearningVariational Proximal Policy OptimizationPAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVRPrune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon ReasoningLLM Reasoning with Process Rewards for Outcome-Guided StepsLatent-GRPO: Group Relative Policy Optimization for Latent ReasoningEntropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language ModelsBoosting LLM Reasoning via Human-Inspired Reward ShapingEBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy OptimizationEvolutionary System Prompt Learning for Reinforcement Learning in LLMsETR: Outcome-Guided Elastic Trust Regions for Policy OptimizationSD-E$^2$: Semantic Exploration for Reasoning Under Token BudgetsLong-horizon Reasoning Agent for Olympiad-Level Mathematical Problem SolvingScRPO: From Errors to Insightsh1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement LearningPinpointing crucial steps: Attribution-based Credit Assignment for Verifiable Reinforcement LearningMARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMsCLAWS:Creativity detection for LLM-generated solutions using Attention Window of SectionsGIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNAKnow When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement LearningWirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement LearningReward Is Enough: LLMs Are In-Context Reinforcement LearnersRL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement LearningTemplateRL: Structured Template-Guided Reinforcement Learning for LLM ReasoningOn the Design of KL-Regularized Policy Gradient Algorithms for LLM ReasoningEnigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable PuzzlesMaximizing Confidence Alone Improves ReasoningDeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition