← all datasets

Claude-Sonnet-4

Emerging
1papers using it
2026first seen

The 'Claude Sonnet 4' dataset/benchmark contains a series of debugging scenarios used to evaluate the performance of AI agents in identifying hidden issues versus surface-level issues based on different motivational framing in system prompts.

Papers using Claude-Sonnet-4 (1)

Claude-Sonnet-4 dataset β€” papers, benchmarks & downloads Β· AI Agents