AIME 2025
Emerging23papers using it
32,099HF downloads
16HF likes
2025first seen
Homepage and repository Homepage: https://matharena.ai/ Repository: https://github.com/eth-sri/matharena Dataset Summary This dataset contains the questions from AIME 2025 used for the MathArena Leaderboard Data Fields The dataset contains the following fields: problem_idx (int64): Problem index within the correspondin
π€ Hugging Faceβ cc-by-nc-sa-4.0
Papers using AIME 2025 (23)
- Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking ModelUloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning AbilitiesGEPA: Reflective Prompt Evolution Can Outperform Reinforcement LearningExpanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought PatternsLearning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-TuningRollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative RegimeMaximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learningexpo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum samplingfg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculumApriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient ReasoningGood SFT Optimizes for SFT, Better SFT Prepares for Reinforcement LearningForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term ContributionBeyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional PairingTraining Large Reasoning Models Efficiently via Progressive Thought EncodingPCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement LearningMarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline ParallelismPlan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM ReasoningUnlocking Reasoning Capabilities in LLMs via Reinforcement Learning ExplorationBAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive ClippingEAPO: Enhancing Policy Optimization with On-Demand Expert AssistanceKimi K2: Open Agentic IntelligenceAdvancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement LearningAceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning