论文
训练量化模型的去向:低位推理的策略蒸馏
Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning
摘要
量化感知蒸馏 (QAD) 恢复了低于 3 位量化所损失的大部分简短问答性能,但数学和代码推理却受到严重损害。长时间的生成通常会退化为重复循环,耗尽解码预算而无法完成解决方案。我们将这一差距追溯到量化放大的暴露偏差:QAD 在固定的语料库前缀上进行训练,而量化引起的偏差沿着模型自身的自回归轨迹复合。为了解决这种不匹配问题,我们引入了策略蒸馏(OPD)阶段,将教师监督置于量化模型实际进行的地方。从 QAD 检查点开始,学生通过部署时使用的量化前向路径进行生成,并从冻结的全精度教师以其自己的前缀接收反馈,将密集的词元级指导与任务验证者奖励相结合。在 2.79 和 1.88 有效位的四个模型中,OPD 将 MATH-500 上的平均 BF16 性能保留率从 35% 提高到 70%,将 HumanEval 上的平均 BF16 性能保留率从 66% 提高到 91%,同时保留简短形式的性能,在匹配预算比较中,推理增益大大超过了持续由教师强制进行的 QAD。通过将 QAD 的稳定低位初始化与 OPD 的策略推理恢复相结合,我们的框架提供了一个全面的低于 3 位的解决方案,可以在恢复长格式推理的同时保留广泛的功能。