Awesome Reinforcement Learning
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Shiji Song — most-cited papers & profile · Reinforcement Learning
← authors
·
overview
Shiji Song
32
papers ·
1181
citations ·
35
h-index
Sichuan University of Science and Engineering · Tsinghua University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
2025 · 761 citations
Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning
2019 · 35 citations
Regularized Anderson Acceleration for Off-Policy Deep Reinforcement Learning
2019 · 12 citations
Hundreds Guide Millions: Adaptive Offline Reinforcement Learning with Expert Guidance
2023 · 9 citations
Smart Train Operation Algorithms based on Expert Knowledge and Reinforcement Learning
2020 · 4 citations
Decoupled Prioritized Resampling for Offline RL
2023 · 3 citations
Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception
2025 · 2 citations
Train Once, Get a Family: State-Adaptive Balances for Offline-to-Online Reinforcement Learning
2023 · 2 citations
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
2025 · 1 citations
Multi Pseudo Q-learning Based Deterministic Policy Gradient for Tracking Control of Autonomous Underwater Vehicles
2019
Boosting Offline Reinforcement Learning with Action Preference Query
2023
Leveraging Reward Consistency for Interpretable Feature Discovery in Reinforcement Learning
2023
A Reinforcement-Learning-Based Multiple-Column Selection Strategy for Column Generation
2023
Deep Reinforcement Learning for Traveling Purchaser Problems
2024
Top co-authors
Gao Huang
· 9
Shenzhi Wang
· 4
Wenjie Shi
· 4
Yang Yue
· 4
Andrew Zhao
· 3
Cheng Wu
· 3
Rui Lu
· 3
C. L. Philip Chen
· 2
Huanqian Wang
· 2
Hui Wu
· 2
An Yang
· 1
Bingyi Kang
· 1
Topics
Model-Based RL
Policy Gradient
Offline RL
Value-Based
RLHF & Alignment
Exploration
Game AI
Safe RL
cs.CV
cs.AI