论文

容忍硬件故障的语言基础模型训练

Fault-tolerant foundation models

模型训练AI 基础设施模型评测预训练AI 芯片鲁棒性、公平性与可信度评测

摘要

新兴的计算机硬件通常会牺牲可靠性来换取能源效率;在这里,我们展示了大语言模型(LLM)可以通过训练来容忍这种不可靠性,并且它们的错误恢复能力实际上会随着它们的成长而增强,而不是降低。根据在模拟故障数字硬件上进行 40,000 个 GPU 小时的训练运行推断出的修改后的神经缩放定律量化了这一趋势,并表明模型学习在“良好”纠错码内进行计算,无论模型有多大,其相对开销仍然是有限的。这一发现使我们推测,经过适当培训的LLM可能具有形式上的容错能力;如果属实,在低能耗、有故障的硬件上运行人工智能推理可能是比现状大幅节省能源的一条途径。

容忍硬件故障的语言基础模型训练:论文原图
图 3:推理时错误对于未经训练的模型来说是致命的。 a,推理时间误差下故障盲模型缩放的分歧。按照惯例,我们期望语言模型性能随着 DD 单调增加。然而,当peval>0p_{\text{eval}}>0时,故障盲模型并不总是表现出这种关键行为:随着pevalp_{\text{eval}}的增加,DD的性能扩展会减弱,并且超过阈值时,性能实际上会随着DD而下降。阴影区域表示报告值的标准误差,该值是根据每个 DD 值的 88 个独立训练模型估计得出的。 b,误差引起的模型 logits 加热。推理时间误差对模型造成的部分退化是输出逻辑的加热:故障盲模型预测的温度随 pevalp_{\text{eval}} 迅速升高,在大 DD 下更是如此,而故障硬化模型则抵抗加热。 c,错误引起的模型逻辑扰乱。即使在消除温度影响后,当 pevalp_{\text{eval}} 升至 00 以上时,故障盲模型也会迅速失去容量,速度更快 较大的DD;故障强化模型几乎保持 peval<ptrainp_{\text{eval}}<p_{\text{train}} 的所有容量,与 DD 无关。 (b) 和 (c) 中的带表示报告值的 IQR,采用不同的训练模型和上下文。 d,根据无故障预测绘制有故障的预测,覆盖许多验证集输入。温度变化使 logit 斑点产生偏差:ptrain=0p_{\text{train}}=0 加热是明显的,并且伴随着大量的随机化,而 ptrain=pevalp_{\text{train}}=p_{\text{eval}} logits 几乎没有位移。