← all datasets

Qwen-2.5-math-7B

Emerging
5papers using it
2025first seen

The 'Qwen-2.5-Math-7B' dataset/benchmark is used to evaluate reinforcement learning with verifiable rewards (RLVR) in training large language models on deterministic outcome reasoning tasks.

Papers using Qwen-2.5-math-7B (5)

Qwen-2.5-math-7B dataset β€” papers, benchmarks & downloads Β· Reinforcement Learning