Awesome AI for Code
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
reinforcement
loadingβ¦
π€
Ask AI
Awesome reinforcement β curated papers, datasets & benchmarks Β· Awesome AI for Code
β all topics
overview
reinforcement
23 papers tagged reinforcement β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
23 papers Β· trending (default)
numbers = π₯ heat
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
(2025)
Liang Wen et al.
6.07
GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
(2025)
GLM-4. 5 Team et al.
3.92
QUASAR: Quantum Assembly Code Generation Using Tool-Augmented LLMs via Agentic RL
(2025)
Cong Yu et al.
3.10
Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
(2026)
Tianci Liu et al.
2.00
Rank-Then-Act: Reward-Free Control from Frame-Order Progress
(2026)
Yuriy Maksyuta et al.
2.00
DrugGen 2: A disease-aware language model for enhancing drug discovery
(2026)
Ali Motahharynia et al.
2.00
Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents
(2026)
Wenxuan Ding et al.
1.94
WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning
(2026)
Juyong Jiang et al.
1.94
Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning
(2026)
Banghao Chi et al.
1.94
Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts
(2026)
Chen Yang et al.
1.72
SERA: Soft-Verified Efficient Repository Agents
(2026)
Ethan Shen et al.
1.67
RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
(2025)
Zichun Yu et al.
1.50
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
(2025)
Shenao Zhang et al.
1.44
Schema-R1: A reasoning training approach for schema linking in Text-to-SQL Task
(2025)
Wuzhenghong Wen et al.
1.28
Technical Report: Full-Stack Fine-Tuning for the Q Programming Language
(2025)
Brendan R. Hogan et al.
1.28
Visual Programmability: A Guide for Code-as-Thought in Chart Understanding
(2025)
Bohao Tang et al.
1.28
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
(2025)
Yuhang Li et al.
1.28
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
(2025)
Jiaan Wang et al.
1.22
Skywork Open Reasoner 1 Technical Report
(2025)
Jujie He et al.
1.22
EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
(2025)
Xiaoqian Liu et al.
1.06
7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement
(2024)
Pu Zhao et al.
β
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
(2024)
Yekun Chai et al.
β
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
(2024)
Zehan Qi et al.
β