GPQA-Diamond
Emerging15papers using it
1,907HF downloads
10HF likes
2025first seen
The 'GPQA-Diamond' dataset/benchmark contains evaluation criteria for assessing the performance of language models in various tasks, specifically focusing on the quality of generated outputs in areas like science, medicine, instruction following, and creative writing.
Papers using GPQA-Diamond (15)
- Nemotron-CrossThink: Scaling Self-Learning beyond Math ReasoningRing-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMsDianJin-R1: Evaluating and Enhancing Financial Reasoning in Large
Language ModelsProcess Reward Models That ThinkOpen-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base ModelRubric-Grounded RL: Structured Judge Rewards for Generalizable ReasoningTRACE: Distilling Where It Matters via Token-Routed Self On-Policy AlignmentAMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement LearningQuantLRM: Quantization of Large Reasoning Models via Fine-Tuning SignalsTransformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language ModelsTraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM ReasoningMARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMsRubrics as Rewards: Reinforcement Learning Beyond Verifiable DomainsKimi K2: Open Agentic IntelligencePrior Prompt Engineering for Reinforcement Fine-Tuning