Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
software
loadingβ¦
π€
Ask AI
Awesome software β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
software
18 papers tagged software β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
18 papers Β· trending (default)
numbers = π₯ heat
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
(2026)
Ibragim Badertdinov et al.
1.94
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
(2026)
Hao Zhang et al.
1.94
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
(2026)
Bingchen Zhao et al.
1.94
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
(2026)
Shoufa Chen et al.
1.94
SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
(2026)
Mohit Raghavendra et al.
1.94
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora
(2026)
Chenkai Pan et al.
1.83
Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
(2025)
Tianbao Xie et al.
1.28
Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering Tasks
(2025)
Hongyuan Tao et al.
1.28
RExBench: Can coding agents autonomously implement AI research extensions?
(2025)
Nicholas Edwards et al.
1.28
SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution
(2025)
Han Li et al.
1.28
Tool-integrated Reinforcement Learning for Repo Deep Search
(2025)
Zexiong Ma et al.
1.28
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
(2025)
Dongfu Jiang et al.
1.28
Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
(2025)
Yueqi Song et al.
1.28
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
(2025)
Yihe Deng et al.
1.28
Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
(2024)
Kexun Zhang et al.
β
Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale
(2024)
Rogerio Bonatti et al.
β
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
(2024)
Huy Nhat Phan et al.
β
CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding Capabilities of CodeLLMs
(2024)
Dung Nguyen Manh et al.
β