← all papers · overview

Theoretical Perspectives On Data Quality And Synergistic Effects In Pre- And Post-training Reasoning Models

Abstract

Large Language Models (LLMs) are pretrained on massive datasets and later instruction-tuned via supervised fine-tuning (SFT) or reinforcement learning (RL). Best practices emphasize large, diverse pretraining data, whereas post-training operates differently: SFT relies on smaller, high-quality datasets, while RL benefits more from scale, with larger amounts of feedback often outweighing label qual

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).