SWEBench-Verified
Emerging32papers using it
2024first seen
Papers using SWEBench-Verified (32)
- Laguna M.1/XS.2 Technical ReportSWE-Pruner: Self-Adaptive Context Pruning for Coding AgentsSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software EvolutionSWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open
Software EvolutionUTBoost: Rigorous Evaluation of Coding Agents on SWE-BenchBeyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic JudgmentSWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning ContextDockerless: Environment-Free Program Verifier for Coding AgentsSWE-Shepherd: Advancing PRMs for Reinforcing Code AgentsAsk or Assume? Uncertainty-Aware Clarification-Seeking in Coding AgentsEGSS: Entropy-guided Stepwise Scaling for Reliable Software EngineeringRethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering AgentsThe Limits of Long-Context Reasoning in Automated Bug FixingRGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language ModelsSpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue LocalizationToward Training Superintelligent Software Agents through Self-Play SWE-RLBOAD: Discovering Hierarchical Software Engineering Agents via Bandit OptimizationLive-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?Improving Code Localization with Repository MemoryCWM: An Open-Weights LLM for Research on Code Generation with World
ModelsHuxley-G\"odel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving MachineTraining Long-Context, Multi-Turn Software Engineering Agents with Reinforcement LearningKodezi Chronos: A Debugging-First Language Model for Repository-Scale Code UnderstandingSWE-rebench: An Automated Pipeline for Task Collection and
Decontaminated Evaluation of Software Engineering AgentsSatori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software
EngineeringA Self-Improving Coding AgentSoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-TuningLingma SWE-GPT: An Open Development-Process-Centric Language Model for
Automated Software ImprovementTraining Software Engineering Agents and Verifiers with SWE-GymHyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks
at ScaleEvaluating Software Development Agents: Patch Patterns, Code Quality,
and Issue Complexity in Real-World GitHub ScenariosRepository Structure-Aware Training Makes SLMs Better Issue Resolver