论文
量化 LLM 推理中的无声故障:空心收敛和故障模式转换的基于分类的分析
Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts
摘要
我们证明,即使在保留任务准确性的情况下,后训练 量化也可以默默地改变 大语言模型 的推理方式。使用由两名独立人工注释者验证的六类故障分类法(Cohen 的 $κ$ = 0.906),我们对来自五个指令调整的 LLM(3B--14B 参数)的 30,000 个思想链输出进行了分类,涉及三个量化精度(FP32、FP16、NF4)和四个推理基准。我们发现,虽然精度在各个精度上都很稳健(最大下降 3.1 pp),但空心收敛(通过不完整或无法验证的推理得出的正确答案)在 NF4 下显示出显着的尺寸相关变化,测试的两个最小模型急剧下降,但 12B 参数及以上的模型保持不变。这种影响也是特定于基准的:GSM8K 绝对不受影响,而 LogiQA 和 ARC-Challenge 显示出最大的变化。此外,在 NF4 下,LLaMA 3.2-3B 中,快捷方式崩溃从 44% 上升到错误答案失败的 78%,而置信度滚雪球从 15.8% 崩溃到接近零,这是准确性指标看不见的质变。最后,我们表明无法从表面级文本特征中可靠地检测到空心收敛(最佳 F1 = 0.53),将其确立为标准评估管道无法捕获的与部署相关的故障模式。