论文

SLAI T-Rex:Ascend SuperPOD 上 DeepSeek-V4 系列的全参数 后训练

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

AI 基础设施分布式训练基础设施

摘要

万亿参数规模的MoE模型的全参数后训练给大规模分布式训练带来了巨大的系统级挑战,包括严重的内存压力、非重叠的通信开销和低效的内核执行。虽然大多数大型 LLM 训练系统都是围绕基于 GPU 的集群构建的,但本报告介绍了升腾 NPU SuperPOD 上的端到端优化实践。使用 DeepSeek-V4 模型系列作为目标工作负载,我们开发了一个涵盖模型级并行性、计算通信编排和底层内核执行的分层优化框架。由此产生的系统实现了 34.22% 的模型 FLOP 利用率 (MFU),比开源基线配方提高了 2.93 倍,同时保持了训练稳定性。在此优化的基础架构之上,我们进一步建立了用于复杂运筹学 (OR) 任务的 CPT 和 SFT 工作流程。我们将集成框架称为 SLAI T-Rex。使用 DeepSeek-V4-Flash,我们开发了面向 OR 的 CPT 和 SFT 数据管道,将收集的域资源与求解器验证的合成优化文档相结合。生成的数据集包含 10K 个高质量 SFT 样本,涵盖四个任务类别和三个问题表示。该专用模型在评估模型中获得了最高的平均零样本 Pass@1 分数,达到 71.81%,分别比 GPT-5.4-Mini 和基础 DeepSeek-V4-Flash 模型高出 3.98 和 11.27 个百分点。总体而言,这项工作展示了从 Ascend 基础设施上高效的万亿参数模型 后训练 到用于基于求解器的数学建模的领域专用 Flash 模型的全栈路径,推进复杂推理的前沿模型系统。