← all datasets

AGIEval-en

Emerging
2papers using it
2025first seen

AGIEval-en is a benchmark used to evaluate the complex reasoning abilities of large language models (LLMs) through reasoning-intensive tasks.

Papers using AGIEval-en (2)

AGIEval-en dataset β€” papers, benchmarks & downloads Β· Large Language Models