← all datasets

TAU-bench

Canonical
11papers using it
2025first seen

The 'TAU-bench' dataset/benchmark contains a collection of tasks designed to evaluate AI agents' performance in multi-turn and multi-step interactions involving the use of external tools.

Papers using TAU-bench (11)

TAU-bench dataset β€” papers, benchmarks & downloads Β· AI Agents