论文
HCRMap:面向3.5D MoE芯粒推理的压力感知热专家驻留映射
HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference
摘要
混合专家(MoE)大语言模型(LLM)推理期间只激活少数专家,但token路由引入持续的英雄热度偏斜:一小组热专家持续接收大多数token,其余专家轻载。在3.5D多芯粒系统上,这种偏斜不仅造成计算不均衡,还放大通信、内存带宽、I/O与执行队列的压力。因此核心问题不是简单减少token移动,而是跨不同内存层级动态放置并复用热专家副本。本文提出HCRMap:面向3.5D MoE推理中压力感知专家副本管理的热专家驻留映射框架。基于专家热度、权重装载成本、迁移开销与运行时资源压力,HCRMap动态决定哪些专家应被提升、保留、降级或逐出;随后把被路由的token组映射到合适的驻留副本,从而联合缓解通信、内存与队列瓶颈。实验结果显示:在prefill与decode阶段,HCRMap较Hydra分别降低端到端延迟43.6%与43.0%,较MoEntwine分别降低34.5%与33.1%,较PIMoE分别降低46.7%与46.0%。
