论文

ForgeTrain:通过利用驱动的人工智能开发打造生产级训练框架

ForgeTrain: Forging Production-Grade Training Frameworks via Harness-Driven AI Development

摘要

训练大型模型仍然依赖于 Megatron-LM 等通用框架,其通用性税限制了特定于场景的优化,并通过累积抽象增加了运行时开销。人工智能代码生成降低了构建框架的成本,并且使每个场景都可以负担得起构建一个框架的成本。我们提出 Forge Engineering:从头开始为每个场景构建专用实现,并在正确性和可用性约束下迭代优化它以实现最佳性能。专用实现不继承抽象边界,因此它们可以跨堆栈集成优化并达到更高的性能上限。我们将这种训练框架范例实例化为 ForgeTrain,它拥有一个可信框架作为黄金​​参考,并单调地放松了从 Bit-for-Bit 到 Surpass 的等价性。跨多个模型硬件配置的实验表明,ForgeTrain 始终能够生成正确的训练引擎,并将 MFU 比现有训练框架提高了 4.7--33.2%。据我们所知,这是第一个由人工智能端到端打造的生产级训练框架,以匹配或超越其人类参考。