论文

TrainSDC:在 大语言模型 训练中描述和减轻静默数据损坏

TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training

AI 基础设施可观测性

摘要

LLM 训练越来越容易受到静默数据损坏 (SDC) 的影响,但现有的保护方法在很大程度上统一处理 Transformer 计算,因为它们的漏洞仍然知之甚少。我们在 Transformer 训练的前向和后向传递中首次系统地描述了跨主要计算接口的 SDC 漏洞。我们的分析揭示了两种不同的错误传播机制:前向传递漏洞高度依赖于位置,Q/K 路径上的故障会产生持续的训练偏差,而后向传递漏洞主要受梯度指数分布而不是计算位置的影响。受这些观察的启发,我们提出了 TrainSDC,这是一个特征引导的保护框架,由 Q/K 路径重新计算、残余增益监控和指数感知梯度缩放组成。 Llama 3.2-1B 和 Qwen3-0.6B 上的实验表明,TrainSDC 在稀疏和密集故障注入下都保持接近无故障执行的训练行为,同时仅引入 1.65%-6.76% 的运行时开销。