论文
揭秘 LLM 推理中的数值不稳定性:利用 HEAL 实现关键任务任务的可重复推理
Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL
摘要
随着 大语言模型 (LLM) 部署到关键任务领域(例如金融、医学和法律),输出可重复性已成为严格的系统要求。虽然从业者使用贪婪解码来消除算法随机性,但具有 16 位精度的经验部署仍然在异构 GPU 上表现出灾难性的输出分歧。通过 SASS 级别的分析,我们揭示了这种不一致的根本原因是在内核边界向下转换期间引入的截断错误。然而,通过全局 FP32 管道实现可重复性会带来严重的系统损失:绕过 16 位硬件加速器会损害计算效率,而升级 KV 缓存会使内存开销增加一倍。为了弥补这一差距,我们提出了混合误差消除 (HEAL),这是一种有针对性的干预措施,可近似 FP32 精度,同时通过两种有针对性的机制解决硬件限制。首先,认识到浮点格式未充分利用 Q、K、V 张量的位宽,HEAL 应用 INT16 量化,在不扩展 KV 缓存占用空间的情况下保持数值稳定性。其次,HEAL 通过代数误差补偿策略合成高精度矩阵乘法,完全在高吞吐量 16 位 Tensor Core 上执行。为了实际评估我们的方法,我们引入了 MCR-Bench,这是一个针对关键任务的可重复性的基准。 HEAL 在下游任务上实现了与 FP32 基线相同水平的可重复性,同时将性能开销降低了高达 7.1 倍。