论文
Mellum2 技术报告
Mellum2 Technical Report
摘要
我们推出了 Mellum 2,这是一种开放权重 12B 参数混合专家 (MoE) 语言模型,每个词元有 2.5B 个活动参数。 Mellum 2 是一种专门用于软件工程的通用语言模型,涵盖代码生成和编辑、调试、多步推理、工具使用和函数调用、代理编码和会话编程辅助,它是专注于完成的 4B 密集 Mellum 模型的后继者。该架构建立在混合专家(64 名专家,8 名活跃专家)的基础上,结合了带有 4 KV 头的分组查询注意力、每四层中的三层上的滑动窗口注意力以及一个多词元预测头,该头既可作为辅助 预训练 目标,又可作为 推测解码 的内置草案模型;每个选择都通过消融进行验证,并以商用 GPU 上的推理效率作为设计约束。 预训练 通过三阶段课程涵盖约 10.6 万亿词元,逐步将混合从不同的网络数据转向精心策划的代码和数学内容,并在 FP8 混合精度和线性衰减为零的预热-保持-衰减时间表下使用 Muon 进行优化。预训练的基础通过层选择性 YaRN 扩展到 128K 上下文窗口,然后分两个阶段进行后训练(监督 微调,然后是 RLVR),产生两个已发布的变体:直接回答的指令模型和在最终答案之前发出显式推理跟踪的思维模型。在代码生成、数学和推理、工具使用、知识和安全基准方面,Mellum 2 与 4B-14B 范围内的开放权重基线具有竞争力,同时以 2.5B 密集模型的每个词元计算运行。我们在 Apache 2.0 许可证下发布了基础、指导和思考检查点,以及有关其背后的架构决策、数据管道和训练配方的报告。