论文

量化使推理膨胀:token膨胀作为低比特推理模型的隐性成本

Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

模型评测模型行为与机制分析

摘要

量化被广泛用于降低大语言模型的推理成本——但其对推理模型的影响未被最终答案准确率或每token延迟完全捕捉。我们表明低比特训练后量化会引入隐藏的测试时算力成本:量化推理模型常生成更长的思维链——即使它们仍正确回答。跨数学推理、代码生成、科学问答与智能体工具使用基准——我们发现INT4/INT3量化可在保持准确率的同时增加推理token使用——抵消预期的每token加速。为度量该效应——我们引入CoT token膨胀比——比较量化与全精度模型的推理长度在全部评估基准上的平均。我们进一步表明token膨胀伴随推理踪迹中的行为变化——包括更多中间步骤与更大的语义重复。这些变化转化为可测量的端到端真实服务惩罚。最后——我们评估缓解策略——发现提示与解码时采样提供不一致的准确率-长度权衡——而量化感知训练在同时降低准确率退化与token膨胀上更有前景。我们的结果提示:评估量化推理模型时——推理token使用应与准确率一同报告。

量化使推理膨胀:token膨胀作为低比特推理模型的隐性成本:论文配图
图 1:MBPP 上 Qwen3-4B(左)和 Qwen3-30B(右)在 BF16 与 INT3 GPTQ 下的每个实例 CoT 步数。每个点都绘制了 BF16 步数(x 轴)与 GPTQ 步数(y 轴)的对比图;虚线表示奇偶校验。对角线上方的点表示量化下的更多推理步骤。