论文
量化小语言模型推理的CUSUM形推理时监视与定向重解码
CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning
摘要
量化的小推理模型可能进入重复或其他无产出轨迹,而标准解码不随轨迹展开自适应。我们研究MGT-B——一个固定的、保权重控制器:把不确定性、重复与局部变化特征的重叠窗口转为位置条件的经验尾概率;以CUSUM形重置累积混合投注因子;报警后恢复一致的较早token与KV缓存状态,再做受约束的重解码。在MATH-500上,每方法1,500次生成的配对三种子评估把精确归一化准确率从普通解码的54.73%提高到56.40%(+1.67个百分点;问题聚类bootstrap 95% CI [+0.47, +2.80]),而前瞻画像的随机干预对照为54.60%。增益在全部三个种子为正,代价是多采样5.14%的token。种子0的消融显示单靠回滚不能解释结果,孤立的重复惩罚反而有害。五样本自一致性达70.0%但用约4.84倍token。然而在更难、不重叠的Omni-MATH评估上,MGT-B得16.60%对普通的16.67%(-0.07分;聚类95% CI [-0.33, +0.20]),多采样2.10% token。因此,MGT-B在所研究配置下对MATH-500提供适度、可复现的局部改进,但该效应不迁移到Omni-MATH,不应被解读为数学推理的普遍改进。