论文

Instella-MoE 技术报告

Instella-MoE Technical Report

摘要

在这项工作中,我们引入了 Instella-MoE,这是一种完全开放的专家混合 (MoE) 语言模型,总参数为 160 亿个,每个词元有 28 亿个活动参数,完全在 AMD Instinct MI300X 和 MI325X GPU 上从头开始训练。 Instella-MoE 将稀疏激活的 MoE 设计与架构和系统级创新相结合,包括门控多头潜在注意力 (Gated MLA) 和 FarSkip-Collective 连接,从而实现高效的大规模训练和推理。该模型是通过多阶段管道开发的,包括 预训练、中期训练、长上下文扩展、带反馈驱动数据管理的监督 微调、直接偏好优化以及多教师 同策略 蒸馏 的强化学习。 Instella-MoE 在标准 预训练 基准测试中获得了 76.7 的平均分数,优于之前的完全开放模型,包括 OLMo-3-7B、SmolLM3-3B 和 OLMoE-1B-7B,同时在可比较的活动参数尺度上与开放权重 MoE 和密集基线(包括 Moonlight-16B-A3B 和 Qwen3.5-4B)保持竞争。在 后训练 之后,我们的最终 Think 检查点在指令跟踪、推理、数学、编码和聊天基准测试中获得了 73.2 的平均分数,在我们的评估中优于完全开放和开放权重模型,且活动参数数量相当或更大。为了支持透明和可重复的研究,我们发布了完整的 Instella-MoE 模型流程,包括模型权重、训练配置、数据混合和训练代码。这些贡献共同为 Instella-MoE 奠定了强大、完全开放的基础,以实现高效、高性能的 MoE 模型和可重复的研究。