论文

MoBiE:后训练 量化下二元专家混合的高效推理

MoBiE: Efficient Inference of Mixture of Binary Experts under Post-Training Quantization

摘要

基于专家混合 (MoE) 的 大语言模型 (LLM) 提供强大的性能,但内存和计算成本较高。权重二值化提供了极高的效率,但专为密集 LLM 设计的现有二值方法难以解决 MoE 特定的问题,包括跨专家冗余、与任务无关的重要性估计和量化引起的路由偏移。为此,我们提出了 MoBiE,这是第一个为基于 MoE 的 LLM 量身定制的二值化框架。 MoBiE 建立在三个核心创新之上: 1. 使用联合 SVD 分解来减少跨专家冗余; 2.将全局损失梯度整合到局部Hessian度量中以增强权重重要性估计; 3.引入由输入零空间引导的误差约束以减轻路由失真。值得注意的是,MoBiE 实现了这些优化,同时不会产生额外的存储开销,在效率和模型性能之间取得了平衡。大量实验表明,MoBiE 在多个基于 MoE 的 LLM 和基准测试中始终优于最先进的二进制方法。例如,在 Qwen3-30B-A3B 上,MoBiE 将困惑度降低了 52.2$\%$,将平均零样本性能提高了 43.4$\%$,实现了超过 2 $\times$ 的推理加速,并进一步缩短了量化时间。该代码可从 https://github.com/Kishon-zzx/MoBiE 获取。