论文

PHOENIX:通过零开销检查点进行热插拔的弹性 LLM 训练

PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint

AI 基础设施分布式训练基础设施

摘要

最先进的 大语言模型 (LLM) 训练需要数以万计的图形处理单元 (GPU) 持续数月,并且会遇到整个软件和硬件堆栈的故障。现有的容错机制要么在无故障执行期间施加不小的开销,要么遭受延长的恢复延迟,特别是在一小部分计算节点经历永久性故障的情况下。无故障开销和恢复延迟之间的权衡形成了一个空间,形成了帕累托前沿。我们提出 PHOENIX 来同时解决这两个优化目标。 PHOENIX 采用了容错机制,可通过热插拔恢复 LLM 训练,即用备用节点替换故障节点,而无需终止整个作业。 PHOENIX 的热插拔是通过两个想法实现的:首先,它利用非关键路径内存检查点机制来实现空间冗余。其次,它引入了通信器重建协议,该协议在运行时用备用节点替换故障节点。 PHOENIX 有效地将内存中检查点与计算重叠,从而在无错误执行期间引入零开销。当节点出现永久性故障时,PHOENIX 可以利用内存检查点以最少的重新计算来重建内存状态。我们跨规模(最多 512 个 NVIDIA A100 GPU)和 LLM(最多 65B 参数)评估 PHOENIX,并观察到零检查点开销,热插拔恢复在 40 秒内完成。这些结果表明,PHOENIX 同时实现了零开销、无错误执行和极低的恢复成本。