Minerval
Emerging10papers using it
2025first seen
The 'Minerval' dataset/benchmark is used to evaluate the effectiveness of reinforcement learning strategies in enhancing the reasoning abilities of large language models, particularly in tasks that require long chain-of-thought generation.
Papers using Minerval (10)
- RLPR: Extrapolating RLVR to General Domains without VerifiersSqueeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language ModelPopuLoRA: Co-Evolving LLM Populations for Reasoning Self-PlaySortedRL: Accelerating RL Training for LLMs through Online Length-Aware SchedulingMinerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMsPrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical ReasoningLong Chain-of-Thought Compression via Fine-Grained Group Policy OptimizationTransformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language ModelsTraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM ReasoningEnhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention