论文
量化推理模型认为他们需要思考更长时间,但事实并非如此
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
摘要
后训练 量化(PTQ)被广泛用于高效部署 大语言模型,但其对推理模型的影响尚不清楚。在数学、编码和科学 QA 中,我们发现激进的 PTQ 会降低准确性,同时增加思想链 (CoT) 长度。令人惊讶的是,我们发现在高达 52% 的量化模型失败中,模型在中间推理步骤中得出了正确答案,但没有将其输出为最终答案。为了理解为什么量化会导致过度思考错误的增加,我们测量了量化和全精度输出分布之间的 词元级 KL 散度。具有高 KL 散度的位置与高下一个标记熵密切相关,并且在这些位置量化模型不成比例地采样过度思考的标记,例如“等待”、“但是”和“替代”。我们证明,简单地对一组精心设计的过度思考标记引入 无需训练 logits 惩罚可以将 CoT 长度减少 12--23%,同时保持或提高 5 个模型(1.5B-32B 参数)、3 种量化方法和 5 个基准的准确性,与惩罚其他标记集相比,产生有利的帕累托准确性与推理成本前沿。量化模型产生的过度思考错误尤其减少了高达 58%。