论文
可逆基础:通过状态保持扩展训练 120B 稀疏 MoE
Reversible Foundations: Training a 120B Sparse MoE through State-Preserving Scaling
摘要
本文报告了在单个 8 个 GPU 节点上端到端训练千亿参数稀疏专家混合物的情况。 LightningLM 0.1V 是一个循环骨干语言模型系列,分四个阶段发展:从小型密集种子,通过 5B 和 9B 专家混合,到在 top-12 路由下具有 460 个路由专家的 120B 模型。每个较大的模型都是从较小模型的训练权重中发展而来的;有效参数从密集种子处的 1.78B 单调上升到 120B 处的 5.93B(约存储的 118.67B 的 5%)。完整的谱系在单个节点上运行,即 8K 环境下的较大阶段,在 120B 规模下达到了 1.78 的发布训练损失。这是一份系统和经验报告。它围绕三个学科组织。可逆性:可逆递归堆栈在向后传递中重建激活而不是存储它们,随着模型的增长保持激活内存平坦。状态保护增长:每次扩展(从密集到教育部,从浅到深,从少数专家到多数专家)都是作为可重复的原则给出的,并伴随着因错误而导致的失败;几次失败都是无声无息的。单节点经济性:120B 通过 TQP 进行训练,TQP 是一种量化基本专家权重和经过训练的低秩适配器的策略,该适配器在 2.26B 适配器参数上承载优化器状态,而不是驻留在路由专家中的 100B+ 参数,将专家路径优化器状态削减约 45 倍。新鲜的是已知原语的集成,而不是任何孤立的原语:一个在单个节点上端到端运行的成长谱系,在从业者级别进行记录,每个域保留的损失作为目标能力(多语言印度语能力、代码)是通过构建学习的证据。发布了模型系列、分词器和训练代码。