← all papers · overview

Variance-reduced Zeroth-order Methods For Fine-tuning Language Models

Abstract

Fine-tuning language models (LMs) has demonstrated success in a wide array of downstream tasks. However, as LMs are scaled up, the memory requirements for backpropagation become prohibitively high. Zeroth-order (ZO) optimization methods can leverage memory-efficient forward passes to estimate gradients. More recently, MeZO, an adaptation of ZO-SGD, has been shown to consistently outperform zero-sh

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).