论文
OPTD:用于少步扩散语言模型的 同策略 过渡 蒸馏 和一致性引导自适应压缩
OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models
摘要
扩散语言模型(dLLM)可以并行预测许多标记,但准确的生成仍然需要许多迭代去噪步骤。少步 蒸馏 通过将多个教师步骤压缩为单个学生转换来加速解码。然而,现有方法构建了对 离策略 轨迹的监督。在推论中,学生的早期并行承诺改变了后来预测的上下文,因此它实际访问的状态偏离了受监督的状态——恰恰是在步骤压缩最积极的时候。 同策略 蒸馏 是解决这种不匹配问题的自然补救措施,但它保留了每个转换应前进的程度:仅匹配教师的下一个动作会限制压缩,而不加区别地合并未来的动作可能会违反中间依赖性。为了解决这个限制,我们提出了 OPTD、同策略 过渡 蒸馏 以及一致性引导的自适应压缩。它从几步学生自己的轨迹中采样部分状态,使用冻结的、只提问的老师来识别与结果一致的未来候选人,并根据当前状态的置信度对他们进行排序。然后,该方法选择最长的前缀,其联合承诺保留了教师的生成结果。设定的瓶颈目标将每个经过验证的未来候选者提升到解码器的输出阈值,而冻结教师 KL 锚则规范所有其他活动位置。目标构建和训练都没有使用标准回答。在四个数学推理和代码生成基准中,OPTD 不断改进质量与效率的权衡,并在评估的几步基准中获得最强的整体质量约束 AUP。