tau-2-bench
Emerging4papers using it
2026first seen
The 'tau-2-bench' dataset/benchmark is designed to evaluate interactive large language model agents in multi-turn dialogue and multi-step tool calling scenarios.
Papers using tau-2-bench (4)
- PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM AgentsToward Scalable Verifiable Reward: Proxy State-based Evaluation For Multi-turn Tool-calling LLM AgentsCurateEvo: Data-Curation Evolving for Agentic Post-TrainingEscaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning