← all datasets

AIME-26

Emerging
2papers using it
2026first seen

The AIME-26 dataset/benchmark contains unlabeled seed questions across math, science, and coding domains, and is used to evaluate the self-improvement capabilities of post-trained large language models through self-curated data generation and validation.

Papers using AIME-26 (2)

AIME-26 dataset β€” papers, benchmarks & downloads Β· Large Language Models