SWE-bench Verified
Emerging71papers using it
2024first seen
Papers using SWE-bench Verified (71)
- Laguna M.1/XS.2 Technical ReportSWE-Pruner: Self-Adaptive Context Pruning for Coding AgentsSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software EvolutionSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open
Software EvolutionFrontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming LanguagesUTBoost: Rigorous Evaluation of Coding Agents on SWE-BenchFunction-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation ModelsSocratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent SkillsBeyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic JudgmentSWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning ContextDockerless: Environment-Free Program Verifier for Coding AgentsBoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward ModelsYet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMsFrom SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering AgentsSWE-Shepherd: Advancing PRMs for Reinforcing Code AgentsSWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR TrainingYour Code Agent Can Grow Alongside You with Structured MemoryCodeScout: An Effective Recipe for Reinforcement Learning of Code Search AgentsAsk or Assume? Uncertainty-Aware Clarification-Seeking in Coding AgentsKAT-Coder-V2 Technical ReportSWE-Universe: Scale Real-World Verifiable Environments to MillionsSWE-Master: Unleashing the Potential of Software Engineering Agents via Post-TrainingSWE-World: Building Software Engineering Agents in Docker-Free EnvironmentsEGSS: Entropy-guided Stepwise Scaling for Reliable Software EngineeringPull Requests as a Training Signal for Repo-Level Code EditingRethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering AgentsSWE Context Bench: A Benchmark for Context Learning in CodingImmersion in the GitHub Universe: Scaling Coding Agents to MasteryThe Limits of Long-Context Reasoning in Automated Bug FixingHybrid-Gym: Training Coding Agents to Generalize Across TasksSWE-Prot\'eg\'e: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering AgentsSWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World RepositoriesRGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language ModelsLearning Adaptive Parallel Execution for Efficient Code LocalizationSWE-Replay: Efficient Test-Time Scaling for Software Engineering AgentsSpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue LocalizationSWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution ScenariosToward Training Superintelligent Software Agents through Self-Play SWE-RLBOAD: Discovering Hierarchical Software Engineering Agents via Bandit OptimizationSelf-Abstraction from Grounded Experience for Plan-Guided Policy RefinementLive-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue ResolutionImproving Code Localization with Repository MemoryCWM: An Open-Weights LLM for Research on Code Generation with World ModelsREFINE: Enhancing Program Repair Agents through Context-Aware Patch RefinementSaving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent EvaluationBugPilot: Complex Bug Generation for Efficient Learning of SWE SkillsCWM: An Open-Weights LLM for Research on Code Generation with World
ModelsHuxley-G\"odel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving MachineReinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code GenerationTraining Long-Context, Multi-Turn Software Engineering Agents with Reinforcement LearningCoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level TasksKodezi Chronos: A Debugging-First Language Model for Repository-Scale Code UnderstandingAssertFlip: Reproducing Bugs via Inversion of LLM-Generated Passing TestsSWE-Dev: Building Software Engineering Agents with Training and Inference ScalingTraining Long-Context, Multi-Turn Software Engineering Agents with
Reinforcement LearningGuided Search Strategies in Non-Serializable Environments with Applications to Software Engineering AgentsSWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering AgentsSatori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software EngineeringSWE-rebench: An Automated Pipeline for Task Collection and
Decontaminated Evaluation of Software Engineering AgentsSatori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software
EngineeringFeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair TasksA Self-Improving Coding AgentSEAlign: Alignment Training for Software Engineering AgentThinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time ComputeSoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-TuningLingma SWE-GPT: An Open Development-Process-Centric Language Model for
Automated Software ImprovementTraining Software Engineering Agents and Verifiers with SWE-GymHyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks
at ScaleEvaluating Software Development Agents: Patch Patterns, Code Quality,
and Issue Complexity in Real-World GitHub ScenariosRepository Structure-Aware Training Makes SLMs Better Issue Resolver