论文

ITC-MoE:MoE 扩散语言模型的重要性引导词元感知压缩

ITC-MoE: Importance-guided Token-aware Compression for MoE Diffusion Language Models

模型优化模型压缩

摘要

专家混合 (MoE) 扩散语言模型 (DLM) 提供灵活的并行解码和增加的模型容量,但其大量的专家参数会产生大量的计算和存储成本。现有的低秩 MoE 压缩方法很大程度上依赖于静态分解和固定秩分配,而忽略了 MoE DLM 的独特属性。具体来说,我们确定了两个属性:跨模式非均匀冗余,其中参数冗余和对秩截断的敏感度在输入、输出和专家模式之间变化,以及词元利用变化,其中热词元和冷词元表现出不同的谱特征和专家激活模式。为了应对这些挑战,我们提出了 ITC-MoE,这是一种用于 MoE DLM 的重要性引导词元感知压缩框架。 ITC-MoE 由两个互补的部分组成。首先,重要性引导的自适应塔克压缩(IATC)将激活和梯度重要性合并到专家权重变换中,跨多种模式联合分解专家权重,并在固定参数预算下自适应分配秩。其次,词元感知补偿和路由(TCR)对压缩敏感的热词元应用轻量级低秩补偿,并通过集中路由模式限制冷词元的候选专家集。通过联合调整压缩容量和推理执行以适应参数冗余和词元方式变化,ITC-MoE 大大降低了 MoE DLM 的计算和存储成本,同时保持其生成质量。例如,在 SDAR-30B-A3B-Chat-b32 上,ITC-MoE 在 30% 的压缩预算下在 MultiArith 上保持了 96.33% 的准确率,同时实现了高达 7.22 倍的端到端加速。该代码可在 https://github.com/lianjunl13-sudo/ITC-MoE. 公开获取