SWT-Bench Verified
Emerging39papers using it
2025first seen
Papers using SWT-Bench Verified (39)
- Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming LanguagesFunction-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation ModelsSocratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent SkillsBoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward ModelsYet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMsFrom SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering AgentsSWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR TrainingYour Code Agent Can Grow Alongside You with Structured MemoryCodeScout: An Effective Recipe for Reinforcement Learning of Code Search AgentsKAT-Coder-V2 Technical ReportSWE-Universe: Scale Real-World Verifiable Environments to MillionsSWE-Master: Unleashing the Potential of Software Engineering Agents via Post-TrainingSWE-World: Building Software Engineering Agents in Docker-Free EnvironmentsPull Requests as a Training Signal for Repo-Level Code EditingSWE Context Bench: A Benchmark for Context Learning in CodingImmersion in the GitHub Universe: Scaling Coding Agents to MasteryHybrid-Gym: Training Coding Agents to Generalize Across TasksSWE-Prot\'eg\'e: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering AgentsSWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World RepositoriesLearning Adaptive Parallel Execution for Efficient Code LocalizationSWE-Replay: Efficient Test-Time Scaling for Software Engineering AgentsSWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution ScenariosSelf-Abstraction from Grounded Experience for Plan-Guided Policy RefinementInfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue ResolutionCWM: An Open-Weights LLM for Research on Code Generation with World ModelsREFINE: Enhancing Program Repair Agents through Context-Aware Patch RefinementSaving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent EvaluationBugPilot: Complex Bug Generation for Efficient Learning of SWE SkillsReinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code GenerationCoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level TasksAssertFlip: Reproducing Bugs via Inversion of LLM-Generated Passing TestsSWE-Dev: Building Software Engineering Agents with Training and Inference ScalingTraining Long-Context, Multi-Turn Software Engineering Agents with
Reinforcement LearningGuided Search Strategies in Non-Serializable Environments with Applications to Software Engineering AgentsSWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering AgentsSatori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software EngineeringFeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair TasksSEAlign: Alignment Training for Software Engineering AgentThinking Longer, Not Larger: Enhancing Software Engineering Agents via
Scaling Test-Time Compute