Awesome Generative Models
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Juntao Dai — most-cited papers & profile · Generative Models
← authors
·
overview
Juntao Dai
22
papers ·
10
citations ·
0
h-index
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
2025 · 10 citations
A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
2026
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
2026
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
2026
Are Your Agents Upward Deceivers?
2025
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
2025
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
2025
SafeLawBench: Towards Safe Alignment of Large Language Models
2025
Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving
2025
Safemt: Multi-turn Safety For Multimodal Language Models
2025
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
2025
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
2025
BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset
2023
Language Models Resist Alignment: Evidence From Data Compression
2024
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
2024
Top co-authors
Boyuan Chen
· 1
Donghai Hong
· 1
He Geng
· 1
Jiaming Ji
· 1
Jiayi Zhou
· 1
Kaile Wang
· 1
Shu Quan
· 1
Sitong Fang
· 1
Tianfang Hao
· 1
Yaodong Yang
· 1
Topics
Safety & Alignment
Evaluation
Reinforcement Learning
Training Techniques
Fine-Tuning
Prompting
Benchmarks
Model Architecture
RLHF & Alignment
Policy Gradient