论文
校准改变未来的决策:多模态大语言模型的在策略训练后量化
Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models
摘要
训练后量化 (PTQ) 降低了多模态大语言模型的部署成本,但校准通常会根据局部目标重建固定序列。这忽略了自回归反馈:量化引起的词元更改会重定向前缀并更改未来状态。然而,仅靠保单覆盖是不够的,因为许多决策不匹配几乎不会影响后代。我们提出了 OnPTQ,一个在政策框架,用于校准当前量化政策所访问的轨迹。在共享前缀上,OnPTQ 识别量化侵蚀的边界,通过简短的反事实部署评估竞争词元,并将当前差异与分支结果结合成决策-结果风险。风险优先考虑关键状态,而上下文锚定和轨迹刷新保留多模态行为并保持校准与更新的策略保持一致。我们进一步推导出一个决策-结果界限,将行为偏差与当前政策差异和行动条件的未来价值范围联系起来。在多个低位设置下的视觉语言和全模态 Qwen 模型中,OnPTQ 提高了下游性能,并针对相应的 Dense/FP16 参考产生更少的正确性翻转,而无需更改已部署的推理图。