论文

FastCI:用于 LLM 训练框架的高效 GPU 密集型 CI

FastCI: Efficient GPU-Intensive CI for LLM Training Frameworks

AI 基础设施AI 开发与运维平台

摘要

随着大语言模型 (LLM) 的规模和复杂性不断增长,其训练框架也在快速发展。因此,持续集成(CI)对于维持这些框架的质量和稳定性至关重要。然而,与传统软件不同的是,LLM 训练框架的 CI 依赖于 GPU 密集型测试,通常涉及完整的模型训练或评估。这导致CI本身成为快节奏发展的新瓶颈。在本文中,我们介绍了FastCI,一个可以提高LLM训练框架的CI效率的框架。 FastCI 利用运行时证据来选择受影响的测试并修剪在等效上下文中执行更改的代码的测试。然后,FastCI 会优先考虑高风险测试,以便更早地暴露潜在故障,并沿着每个测试的预期验证范围之外的维度优化测试工作负载。对我们的 LLM 训练框架的 CI 工作负载进行评估,与当前部署的 CI 管道相比,FastCI 将 CI 延迟降低了 77.5%,GPU 资源使用率降低了 63.9%,同时将修改后的代码覆盖率保留率提高了 3.2%。 FastCI 现已集成到字节跳动 LLM 训练框架的 CI 管道中。