Claude-Sonnet-4
Emerging1papers using it
2026first seen
The 'Claude Sonnet 4' dataset/benchmark contains a series of debugging scenarios used to evaluate the performance of AI agents in identifying hidden issues versus surface-level issues based on different motivational framing in system prompts.