MMLU
Emerging13papers using it
461,151HF downloads
803HF likes
2025first seen
Dataset Card for MMLU Dataset Summary Measuring Massive Multitask Language Understanding by Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt (ICLR 2021). This is a massive multitask test consisting of multiple-choice questions from various branches of knowledge. The
π€ Hugging Faceβ mit
Papers using MMLU (13)
- SEM: Reinforcement Learning for Search-Efficient Large Language ModelsRUMAD: Reinforcement-Unifying Multi-Agent DebateOpen-Medical-R1: How to Choose Data for RLVR Training at Medicine DomainComplementing reinforcement learning with SFT through logit averaging in the post training of LLMsMDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction FollowingLEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement LearningPost-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy DistillationData Agent: Learning to Select Data via End-to-End Dynamic OptimizationASI-Evolve: AI Accelerates AIFlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement LearningReward Model Routing in AlignmentMASPRM: Multi-Agent System Process Reward ModelAre DeepSeek R1 And Other Reasoning Models More Faithful?