Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
from
loadingβ¦
π€
Ask AI
Awesome from β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
from
18 papers tagged from β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
18 papers Β· trending (default)
numbers = π₯ heat
Your Group-Relative Advantage Is Biased
(2026)
Fengkai Yang et al.
1.94
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
(2026)
Zili Wang et al.
1.94
RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation
(2025)
Kaiqu Liang et al.
1.28
PILAF: Optimal Human Preference Sampling for Reward Modeling
(2025)
Yunzhen Feng et al.
1.28
Iterative Value Function Optimization for Guided Decoding
(2025)
Zhenhua Liu et al.
1.28
Accelerating Nash Learning from Human Feedback via Mirror Prox
(2025)
Daniil Tiapkin et al.
1.28
The Era of Real-World Human Interaction: RL from User Conversations
(2025)
Chuanyang Jin et al.
1.28
Visual Jigsaw Post-Training Improves MLLMs
(2025)
Penghao Wu et al.
1.28
ExGRPO: Learning to Reason from Experience
(2025)
Runzhe Zhan et al.
1.28
PokeeResearch: Effective Deep Research via Reinforcement Learning from AI Feedback and Robust Reasoning Scaffold
(2025)
Yi Wan et al.
1.28
Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
(2023)
Stephen Casper et al.
β
ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers
(2024)
Chen Zheng et al.
β
MusicRL: Aligning Music Generation to Human Preferences
(2024)
Geoffrey Cideron et al.
β
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
(2024)
Natasha Butt et al.
β
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
(2024)
Gerald Shen et al.
β
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
(2024)
Guanting Dong et al.
β
Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing
(2024)
Huanqian Wang et al.
β
SePPO: Semi-Policy Preference Optimization for Diffusion Alignment
(2024)
Daoan Zhang et al.
β