论文
用于预先检测 LLM 训练不稳定性的机制驱动监视器
Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability
摘要
Frontier 大语言模型 训练消耗大量加速器组和长时间的挂钟计算,导致稳定性故障发生时代价高昂。在数值或超参数故障已经使训练动态不稳定之后,它可能会持续数千步,而损失和梯度范数仍然显示正常。我们通过从每个关键模块的功能角色以及从最早的计算站点(预计故障会产生可测量的签名)派生内部监视器来研究训练不稳定性的机制驱动检测。对于低精度闪光注意力,我们监控 QK 双线性分解的谱熵,其一阶项在损失完全崩溃之前变得异常。对于 MoE 路由器,我们从其在专家选择中的作用得出指标。我们对低精度注意力、大学习率和组合故障的故障注入实验表明,这些信号为不同的故障提供了不同的特征,在损失发散之前触发了数千个步骤。