← all datasets

tau-2-bench

Emerging
4papers using it
2026first seen

The 'tau-2-bench' dataset/benchmark is designed to evaluate interactive large language model agents in multi-turn dialogue and multi-step tool calling scenarios.

Papers using tau-2-bench (4)

tau-2-bench β€” datasets β€” llm-papers