Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Gang Pan — most-cited papers & profile · Multimodal
← authors
·
overview
Gang Pan
18
papers ·
84
citations ·
0
h-index
Zhejiang University of Science and Technology · Zhejiang Lab · Anhui Provincial Hospital · Zhejiang University of Technology · Zhejiang University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Qualitative Measurements of Policy Discrepancy for Return-Based Deep Q-Network
2018 · 22 citations
Constrained Update Projection Approach to Safe Policy Optimization
2022 · 19 citations
A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning
2018 · 16 citations
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
2025 · 10 citations
CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning
2022 · 7 citations
State Distribution-aware Sampling for Deep Q-learning
2018 · 5 citations
TBQ($σ$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning
2019 · 2 citations
Policy Optimization with Stochastic Mirror Descent
2019 · 2 citations
CausalCOMRL: Context-Based Offline Meta-Reinforcement Learning with Causal Representation
2025 · 1 citations
The Composite Task Challenge for Cooperative Multi-Agent Reinforcement Learning
2025
Expected Sarsa($λ$) with Control Variate for Variance Reduction
2019
FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control
2019
Gradient Q$(σ, λ)$: A Unified Algorithm with Function Approximation for Reinforcement Learning
2019
Sample Complexity of Policy Gradient Finding Second-Order Stationary Points
2020
FP3O: Enabling Proximal Policy Optimization in Multi-Agent Cooperation with Parameter-Sharing Versatility
2023
Topics
Policy Gradient
Value-Based
Offline RL
Model-Based RL
Multi-Agent
Exploration
Game AI
Safe RL
RLHF & Alignment
Meta-RL