论文

量化推理模型的校准e-CUSUM解码:为何token对数概率是解码监视器的错误观测量

Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors

模型推理解码与生成控制

摘要

低比特量化使小推理模型部署便宜,但可能损害其思维链。这催生了在生成变得不可靠时干预的解码器侧监视器。我们证明一个自然候选——中心化token对数概率增量log p(w_t)+H_t——是这一用途的错误观测量:在模型自身采样律下它由构造即为零均值鞅,度量的是采样自洽性而非轨迹健康,且在自信重复期间近乎沉默——log p(w_t)与熵都接近零。我们引入免训练解码控制器:组合(i)退化感知报警分——融合token不确定性与显式逐字重复,与(ii)经校准的e过程式序贯检测器。原始乘积过程在条件均值零假设下Ville有效;部署的CUSUM下限统计量因分数历史依赖且自相关,被视为经验性变化检测器。在GSM8K上、DeepSeek-R1-Distill-Qwen-1.5B的FP16与INT4下:校准把一个在93–95%生成上触发报警的监视器,变成失败轨迹的选择性检测器(φ≈0.3,精度≈0.6,基率0.38)。在该试点中,控制器减少测得的逐字退化信号,并产生正向但统计不确论的INT4准确率变化(63%到69%,配对McNemar p=0.18,n=100),token预算代价28%。我们还发现GSM8K上的主导失败模式是不终止而非循环。主要贡献是方法论的:解释为何中心化token对数概率不适合解码监视,以及一个经校准、谨慎评估的替代方案。