论文
在 LLM 训练中探索静默数据损坏作为可靠性挑战
Exploring Silent Data Corruption as a Reliability Challenge in LLM Training
摘要
随着 大语言模型 (LLM) 规模和复杂性的扩大,训练期间失败的后果变得越来越严重。静默数据损坏 (SDC) 带来了一个主要挑战:绕过系统级检测机制的硬件引起的故障。 SDC 的行为可能类似于良性数值噪声,但也可能导致有害的梯度损坏,从而导致损失峰值、发散或进度停滞。这项工作提供了间歇性 SDC 如何影响 LLM 预训练的对照研究。在 GPU 矩阵乘法指令级别使用有针对性的故障注入,我们表征了不同位位置、内核函数和执行阶段的敏感性。我们的分析表明,源自本地的故障可能会产生严重的损坏,包括 NaN 传播、损失的短暂峰值、梯度范数和注意力 logits,以及持久的参数发散。基于观察到的损坏签名,我们提出了一种轻量级检测方法,可以识别潜在有害的参数更新。在具有 60M、350M 和 1.3B 参数的 LLaMA 模型上进行的实验表明,在检测到时重新计算最新的训练步骤可以有效减轻这些事件的影响。