论文
Motif 3技术报告:314B参数细粒度MoE语言模型
Motif 3: Technical Report
摘要
我们推出Motif 3,一个decoder-only混合专家(MoE)语言模型,总参数3140亿,每token激活132亿。每个稀疏MoE层包含384个路由专家,每token选8个。这种细粒度稀疏性在提供可观专家容量的同时限制了计算量。Motif 3以分组差分潜在注意力(GDLA)为核心,将分组差分注意力与多头潜在注意力的压缩键值表示相结合。架构还引入改进的流形约束超连接、专家专属PolyNorm激活与多token预测,以提升优化稳定性、专家专业化与推理效率。我们在约12.5万亿token上预训练Motif 3,语料涵盖网页文档、STEM、代码、数学、多语言内容与领域专用语料。专家均衡与数值稳定化技术支撑大规模稳定训练;选择性MXFP8计算与通信、省内存的融合算子以及窗口感知的上下文并行,使上下文长度最高可达256K token的训练成为可能。我们的后训练流水线结合了通用监督微调、六个用强化学习训练的专家教师、一个用监督微调训练的软件工程教师,以及多教师同策略蒸馏(Multi-teacher On-Policy Distillation)。最终的统一模型整合了推理、编码、工具使用、专业工作、长上下文理解、校准弃答与指令遵循等互补能力。在广泛的评测套件上,Motif 3相较领先的开放权重模型表现出竞争力,包括在长程agentic任务、数学推理、科学知识与幻觉敏感评测上的强劲结果。
