MMLU-Pro
Emerging17papers using it
159,076HF downloads
504HF likes
2025first seen
MMLU-Pro Dataset MMLU-Pro dataset is a more robust and challenging massive multi-task understanding dataset tailored to more rigorously benchmark large language models' capabilities. This dataset contains 12K complex questions across various disciplines. |Github | 🏆Leaderboard | 📖Paper | 🚀 What's New [2026.03.11] Ad
🤗 Hugging Face⚖ mit
Papers using MMLU-Pro (17)
- Nemotron-CrossThink: Scaling Self-Learning beyond Math ReasoningOpen-Medical-R1: How to Choose Data for RLVR Training at Medicine DomainGroup-Aware Reinforcement Learning for Output Diversity in Large Language ModelsWarm Up Before You Train: Unlocking General Reasoning in Resource-Constrained SettingsVSPO: Vector-Steered Policy Optimization for Behavioral ControlApriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient ReasoningSUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural InstructionsReinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model ReasoningFlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement LearningTraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM ReasoningCan LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM ReasoningLearning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement LearningEvolving Language Models without Labels: Majority Drives Selection, Novelty Promotes VariationUR$^2$: Unify RAG and Reasoning through Reinforcement LearningReinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-TrainingStep-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMsReinforcing General Reasoning without Verifiers