论文

Stepped MoE:可配置推理复杂度的段级路由

Stepped MoE: Segment-Level Routing with Configurable Inference Complexity

摘要

训练大语言模型 (LLM) 是资源密集型的,使它们适应具有不同计算限制的不同部署场景仍然具有挑战性。虽然弹性架构支持灵活的模型部署,并且稀疏激活的模型允许输入自适应计算,但现有方法独立处理这些维度。此外,面向设备边缘推理的模型需要符合记忆并计算服务设备的限制。在本文中,我们介绍了一个统一的框架,它将弹性结构与稀疏门控架构相结合,以创建同时适应部署约束和任务要求的模型。我们的方法采用模型 骨干模型,该模型以上下文和目标效率规范为条件,从而能够对推理时的准确性与效率权衡进行细粒度控制。该模型学习在弹性嵌套子网络内激活与任务相关的参数,从而允许单个模型跨越多个容量点,同时保持输入自适应路由。通过实验,我们证明我们可以创建一个模型,允许灵活地使用 1,2,34,000,000 个参数,同时比其密集对应模型(知识密集型基准测试为 2-5\%)更准确,并与其静态版本持平,同时提供与密集模型类似的延迟指标。总体而言,我们通过共享模型参数节省了设备磁盘空间,允许基于 DRAM 和可用计算的灵活性提供服务,同时提供更准确的结果。

Stepped MoE:可配置推理复杂度的段级路由:论文原图
图 1:左:基于传统 MoE 的架构,其中每层根据 token 选择专家;中:步进式 MoE 架构,使用掩码生成器决定所有层立即使用的专家;右:准确度-延迟权衡曲线,显示步进式 MoE 如何弥合密集模型和 MoE 模型之间的差距(气泡大小代表模型的活动大小)。