论文

ROMER:模拟内存计算系统上稳健的 MoE LLM 的专家更换和路由器校准

ROMER: Expert Replacement and Router Calibration for Robust MoE LLMs on Analog Compute-in-Memory Systems

摘要

具有专家混合 (MoE) 架构的 大语言模型 (LLM) 通过稀疏地激活每个词元的专家子集来实现显着的可扩展性,但其频繁的专家切换会造成内存带宽瓶颈,而内存计算 (CIM) 架构非常适合缓解这一瓶颈。然而,模拟 CIM 系统存在固有的硬件缺陷,会扰乱存储的权重,并且其在嘈杂的 CIM 环境中对基于 MoE 的 LLM 的负面影响仍未得到探索。在这项工作中,我们首次对基于 MoE 的 LLM 在使用真实芯片测量进行校准的噪声模型下进行了系统研究,揭示了硬件噪声严重破坏了专家负载平衡,并使经过干净训练的路由决策始终处于次优状态。基于这些发现,我们提出了 ROMER,一种 后训练 校准框架,该框架(1)用高频专家替换不活跃的专家以恢复负载平衡,以及(2)通过基于百分位数的归一化重新校准路由器 logits 以稳定噪声下的路由。跨多个基准的大量实验表明,ROMER 在 DeepSeek-MoE、Qwen-MoE 和 OLMoE 的真实芯片噪声条件下分别实现了高达 58.6%、58.8% 和 59.8% 的困惑度降低,确立了其在不同 MoE 架构中的有效性和通用性。