论文

PithTrain:紧凑型原生代理 MoE 训练系统

PithTrain: A Compact and Agent-Native MoE Training System

AI 基础设施分布式训练基础设施

摘要

Mixture-of-Experts (MoE) 已成为前沿语言模型的主导架构。为了满足这一需求,生产框架经过多年的工程努力构建了优化的 MoE 训练堆栈。然而,为新的架构和系统优化而发展这些堆栈仍然很昂贵。随着 AI 编码智能体 的兴起,他们可以自动化部分训练框架开发并加速这一发展。但将它们应用到这些现有框架会带来隐性成本,这对于当今仅吞吐量的评估来说是不可见的。我们将这个缺失的维度命名为代理任务效率(ATE):使用 编码智能体 来理解、操作和扩展框架的成本。基于四个代理原生设计原则,我们构建了 PithTrain,一个紧凑的代理原生 MoE 训练框架。我们进一步介绍 ATE-Bench,涵盖现实世界的训练框架任务。我们的评估显示 PithTrain 与生产框架的吞吐量相匹配,并且在 ATE-Bench 上,PithTrain 可实现更高的代理任务效率,代理轮次减少高达 62%,活动 GPU 时间减少 64%。