SWE-bench Verified
Emerging14papers using it
77,725HF downloads
112HF likes
2025first seen
Dataset Summary SWE-bench Verified is a subset of 500 samples from the SWE-bench test set, which have been human-validated for quality. SWE-bench is a dataset that tests systems’ ability to solve GitHub issues automatically. See this post for more details on the human-validation process. The dataset collects 500 test I
Papers using SWE-bench Verified (14)
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement LearningTraining Long-Context, Multi-Turn Software Engineering Agents with Reinforcement LearningStabilizing Long-term Multi-turn Reinforcement Learning with Gated RewardsSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software EvolutionRollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative RegimeRevisiting DAgger in the Era of LLM-AgentsCODESKILL: Learning Self-Evolving Skills for Coding AgentsRTMC: Step-Level Credit Assignment via Rollout TreesCodeScout: An Effective Recipe for Reinforcement Learning of Code Search AgentsKAT-Coder-V2 Technical ReportToward Training Superintelligent Software Agents through Self-Play SWE-RLReinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code GenerationKimi K2: Open Agentic IntelligenceSatori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering