← all papers · overview

Efficient Stagewise Pretraining Via Progressive Subnetworks

Abstract

Recent developments in large language models have sparked interest in efficient pretraining methods. Stagewise training approaches to improve efficiency, like gradual stacking and layer dropping (Reddi et al, 2023; Zhang & He, 2020), have recently garnered attention. The prevailing view suggests that stagewise dropping strategies, such as layer dropping, are ineffective, especially when compared t

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).