← all papers · overview

Delta Decompression For Moe-based Llms Compression

Abstract

Mixture-of-Experts (MoE) architectures in large language models (LLMs) achieve exceptional performance, but face prohibitive storage and memory requirements. To address these challenges, we present -MoE, a new delta decompression compressor for reducing the parameters of MoE LLMs. Based on observations of expert diversity, we decompose their weights into a shared base weight and unique delt

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).