Awesome Reinforcement Learning
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Baolin Peng — most-cited papers & profile · Reinforcement Learning
← authors
·
overview
Baolin Peng
40
papers ·
950
citations ·
32
h-index
Zhejiang University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Deep Dyna-Q: Integrating Planning for Task-Completion Dialogue Policy Learning
2018 · 185 citations
Composite Task-Completion Dialogue Policy Learning via Hierarchical Deep Reinforcement Learning
2017 · 153 citations
Guided Dialog Policy Learning without Adversarial Learning in the Loop
2020 · 13 citations
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
2025 · 1 citations
Hierarchical Reinforcement Learning for Automatic Disease Diagnosis
2020 · 1 citations
The Trickle-down Impact of Reward (In-)consistency on RLHF
2023 · 1 citations
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
2026
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
2026
Orchard: An Open-Source Agentic Modeling Framework
2026
Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents
2025
ThetaEvolve: Test-time Learning on Open Problems
2025
Dyna-Mind: Learning to Simulate from Experience for Better AI Agents
2025
On the Emergence of Thinking in LLMs I: Searching for the Right Intuition
2025
Top co-authors
Jianfeng Gao
· 10
Hao Cheng
· 8
Qianhui Wu
· 5
Wenlin Yao
· 4
Xiao Yu
· 3
Yelong Shen
· 3
Zhou Yu
· 3
Janardhan Kulkarni
· 2
Liliang Ren
· 2
Pengcheng He
· 2
Rui Yang
· 2
Shuohang Wang
· 2
Topics
Policy Gradient
Model-Based RL
cs.AI
cs.CL
cs.LG
RLHF & Alignment
Exploration
cs.CV
Value-Based
Offline RL