论文
形状变异专家压缩:LorExperts 和 BTExperts
Shape Mutating Expert Compression:LorExperts and BTExperts
摘要
专家混合 (MoE) 语言模型以较低的每个词元计算量提供高容量,但廉价地部署它们需要压缩其许多专家权重矩阵。专家剪枝(例如 REAP)和合并降低了成本,但牺牲了准确性,并且需要重新训练路由器;专家的低秩增量分解(例如,D^2-MoE)保留了所有专家和路由器,但随着专家数量的增长而急剧退化,因为单个共享组件无法近似许多近正交的专家。由于 MoE 专家权重接近正交,因此单个共享组件(如之前的 Delta 分解)与专家数量的缩放比例很差;我们表明,专家仍然组织成与权重相似性脱钩的功能性共激活社区。在此基础上,我们引入了 LorExperts,一种保留路由器的压缩方法,该方法对专家进行聚类,为每个集群保留一个全精度主导,并将其余成员表示为其本地主导的低秩校正。 LorExperts 保留所有专家和原始路由器(无路由器重新训练)。在 Qwen3-30B-A3B 和 Gemma-4-26B-A4B 上约 50% 的专家压缩下,LorExperts 在大多数任务上比基线更好地保留了下游准确性和困惑度; D^2-MoE 上的余量随着专家计数 E 的增加而增长。我们进一步给出了 LorExperts 和 BTExperts 的重建 微调 过程,这是一个由主导和校正组成的树形组织,可以实现共享计算的推理时间摊销。