Awesome Reinforcement Learning
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Zeming Wei — most-cited papers & profile · Reinforcement Learning
← authors
·
overview
Zeming Wei
19
papers ·
69
citations ·
0
h-index
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
A Theoretical Understanding Of Self-correction Through In-context Alignment
2024 · 61 citations
Boosting Jailbreak Attack With Momentum
2024 · 7 citations
Automata-Based Steering of Large Language Models for Diverse Structured Generation
2025 · 1 citations
When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study
2026
Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation
2025
The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems
2026
Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation
2025
False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize
2025
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
2025
ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction
2025
False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize
2025
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
2025
Secure LLM Fine-Tuning via Safety-Aware Probing
2025
Unveiling the Basin-Like Loss Landscape in Large Language Models
2025
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
2023
Top co-authors
Bryan Dai
· 1
Chutian Wang
· 1
Jialong Sun
· 1
Jiaye Teng
· 1
Ran Tao
· 1
Yihao Xiao
· 1
Zitian Gao
· 1
Topics
Adversarial ML
LLM Security
Safety & Alignment
Evaluation
Vulnerability Detection
Fine-Tuning
Training Techniques
In-Context Learning
Threat Intelligence
RAG