MLR-Bench
Emerging1papers using it
2025first seen
MLR-Bench is a comprehensive benchmark designed to evaluate AI agents on open-ended machine learning research, containing 201 research tasks, an automated evaluation framework (MLR-Judge), and a modular agent scaffold (MLR-Agent) for completing research tasks.