论文

OnlineQAT:以在线蒸馏恢复超低比特大语言模型

OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models

模型优化模型训练监督微调与指令调优量化蒸馏

摘要

量化感知训练 (QAT) 可以恢复大型语言模型压缩到四位以下时损失的大部分准确性。然而,现有的恢复阶段通常针对固定完成或教师生成的答案进行优化,而部署的量化模型条件则针对其自身生成的前缀。因此,量化误差可能会使模型进入离线恢复数据所不存在的状态。我们引入 OnlineQAT,这是一个两阶段框架,首先通过块式 QAT 获得可用的低位初始化,然后对学生生成的响应执行策略蒸馏(OPD)。在每个访问的前缀处,冻结的全精度教师提供采样的反向 KL 训练信号。在Qwen3-1.7B上,OnlineQAT在比较的量化方法中获得了最好的平均值:W3A16为57.28,W2A16为32.52,分别比ReasoningQAT提高了2.90和0.44分。结果表明,学生访问的状态提供了超出固定完成训练的有用恢复信号,特别是在三位上。