论文

BitCal-TTS:量化推理模型的位校准测试时扩展

BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models

模型推理测试时计算扩展

摘要

训练后量化使大型推理模型在内存和延迟预算紧张的情况下变得实用,但它可能会扭曲驱动自适应测试时计算分配的在线信号。在新生成的词元数量的固定上限下,错误校准的置信度可能会导致有害的早期停止:模型可能会出现看似合理的最终线,而潜在的推理仍然是错误的,或者控制器可能会在跟踪稳定之前停止。我们研究了贪婪 4 位推理的这种交互,并提出了 BitCal-TTS,这是一种轻量级运行时控制器,它结合了(i)用于词元级不确定性和推理跟踪稳定性的廉价在线代理,(ii)在低标称精度下保守的位条件置信度重新调整,以及(iii)专为 GSM8K 式结构化输出设计的位感知后标记确认范围。该方法不需要对基础模型进行微调,并使用前向钩子实现logits和最后一层隐藏状态,并与标准 Hugging Face 4 位推理集成。在采用 Qwen2.5 Instruct 模型的 GSM8K 小型评估分片上,BitCal-TTS 在 7B 和 14B 规模上比非位感知自适应基线提高了精确匹配精度,同时相对于固定预算解码节省了大量词元。在 B=512 的token上限下,在我们报告的评估分片上(7B 的 N=54,14B 的 N=35;不是完整的 GSM8K 测试集),准确度增益分别为 +3.7 分 (7B) 和 +2.8 分 (14B),过早停止率在 7B 上从 14.8% 下降到 11.1%,在 7B 上从 17.1% 下降到 11.4%。 14B。我们报告了 Wilson 95% 的置信区间,并明确讨论了部分分片比较的有限统计功效。我们发布代码和图形生成脚本以支持完整再现。