论文

Motif 3技术报告:314B参数细粒度MoE语言模型

Motif 3: Technical Report

模型架构模型训练TransformerMoE强化学习Agentic RL

摘要

我们推出Motif 3,一个decoder-only混合专家(MoE)语言模型,总参数3140亿,每token激活132亿。每个稀疏MoE层包含384个路由专家,每token选8个。这种细粒度稀疏性在提供可观专家容量的同时限制了计算量。Motif 3以分组差分潜在注意力(GDLA)为核心,将分组差分注意力与多头潜在注意力的压缩键值表示相结合。架构还引入改进的流形约束超连接、专家专属PolyNorm激活与多token预测,以提升优化稳定性、专家专业化与推理效率。我们在约12.5万亿token上预训练Motif 3,语料涵盖网页文档、STEM、代码、数学、多语言内容与领域专用语料。专家均衡与数值稳定化技术支撑大规模稳定训练;选择性MXFP8计算与通信、省内存的融合算子以及窗口感知的上下文并行,使上下文长度最高可达256K token的训练成为可能。我们的后训练流水线结合了通用监督微调、六个用强化学习训练的专家教师、一个用监督微调训练的软件工程教师,以及多教师同策略蒸馏(Multi-teacher On-Policy Distillation)。最终的统一模型整合了推理、编码、工具使用、专业工作、长上下文理解、校准弃答与指令遵循等互补能力。在广泛的评测套件上,Motif 3相较领先的开放权重模型表现出竞争力,包括在长程agentic任务、数学推理、科学知识与幻觉敏感评测上的强劲结果。

Motif 3技术报告:314B参数细粒度MoE语言模型:论文配图
图3:整体低精度训练方案。颜色表示数值精度:青色为MXFP8,蓝色为BF16,桃色为FP32。虚线边框标记跨rank的集合通信。只有行方向的MXFP8权重被All-Gather;Dgrad所需的列方向副本由一个融合的行转列转码内核在本地生成。专家激活在EP分发前量化一次,使分发本身能够使用MXFP8。梯度同步交换BF16分片,同时在本地以FP32执行每次归约。