论文

推理模型中的极低比特推理:失败模式与靶向恢复

Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

摘要

大型推理模型 (LRM) 依赖于长推理轨迹,导致推理成本高昂。虽然低位量化降低了每个令牌的解码成本,但我们表明,激进的 2 位推理可能无法提供端到端加速,因为生成过程中的不稳定会增加令牌总数。 2 位量化不仅会降低答案准确性,而且通常会产生更长的轨迹,其中包括重复循环、预算耗尽、延迟承诺和未封闭的推理段。我们分析了 Qwen3 推理模型在数学和常识基准上的完整推理轨迹,并表明准确性下降与这些过程级故障紧密相关。为了解决这些问题,我们引入了两种轻量级控件:FP16 规划,它为 2 位模型提供了简短的高精度轮廓;循环救援,它检测重复的跟踪,并提交较早的答案或回退到 FP16。在 MATH-500 上,循环救援将 Qwen3-8B 的准确率从 17.2% 提高到 74.2%,而规划加循环救援将 Qwen3-32B 的准确率从 65.0% 提高到 87.2%。总的来说,我们的结果表明,当极低位推理的故障被视为可控的生成病理时,它就变得实用:通过轻量级检测和选择性 FP16 支持,2 位推理可以恢复准确性,同时保持真正的端到端速度。我们的代码位于:https://github.com/brain-lab-research/quantized-reasoning。

推理模型中的极低比特推理:失败模式与靶向恢复:论文配图
图 1:低位推理的高级视图。