论文
超越无再训练 MoE 压缩:压缩后调整的成本标准化研究
Beyond Retraining-Free MoE Compression: A Cost-Normalized Study of Post-Compression Adjustment
摘要
无需重新训练的 MoE 压缩通过修剪或合并专家来减少部署内存,但通常将压缩的检查点视为最终工件。我们认为这种观点是不完整的:压缩的 MoE 检查点更好地理解为受益于微小的压缩后调整阶段的压缩初始化。通过两个 MoE LLM 主干、四种修剪/合并方法、三种专家保留率和 28 个基准,我们在匹配的小数据预算和测量的 GPU 成本下比较 LM 微调 和基于教师的 KD。仅使用 3,000 个 C4 示例和一次调整,Full FT 平均恢复了原始压缩性能差距的 37.3%。此外,LM 微调 比标准 词元级 KD 更具成本效益,全参数调整在测试示波器中提供了最强的成本-恢复权衡。这些结果表明,无再训练压缩应与小的压缩后调整配合使用,以恢复压缩期间损失的大部分性能。