← all datasets

MLR-Bench

Emerging
1papers using it
2025first seen

MLR-Bench is a comprehensive benchmark designed to evaluate AI agents on open-ended machine learning research, containing 201 research tasks, an automated evaluation framework (MLR-Judge), and a modular agent scaffold (MLR-Agent) for completing research tasks.

Papers using MLR-Bench (1)

MLR-Bench dataset β€” papers, benchmarks & downloads Β· AI for Science