← all papers · overview

APT: Adaptive Pruning And Tuning Pretrained Language Models For Efficient Training And Inference

Abstract

Fine-tuning and inference with large Language Models (LM) are generally known to be expensive. Parameter-efficient fine-tuning over pretrained LMs reduces training memory by updating a small number of LM parameters but does not improve inference efficiency. Structured pruning improves LM inference efficiency by removing consistent parameter blocks, yet often increases training memory and time. To

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).