论文

面向加速扩散语言模型解码的渐进细化调控

Progressive Refinement Regulation for Accelerating Diffusion Language Model Decoding

模型推理推理加速

摘要

扩散语言模型通过在统一细化规则下对所有 token 迭代去噪来生成文本。然而实践中各 token 稳定速度不同,导致大量冗余细化,催生对去噪过程的细化控制需求。既有方法通常在固定解码过程下从瞬时、步级信号评估细化必要性。相反,一个 token 是否收敛由其预测沿未来细化轨迹的变化决定。而且,改变细化规则会重塑未来细化轨迹,而后者又决定细化规则应如何制定,使细化控制本质上是动态的。我们提出渐进细化调控(PRR),一个渐进的、基于轨迹的细化控制框架,从完整解码 rollout 导出 token 级的经验收敛进度。基于该信号,PRR 在渐进自演化训练方案下学习轻量 token 级控制器,通过基于温度的分布塑形调控细化。实验表明,PRR 大幅加速扩散语言模型解码,同时保持生成质量。

面向加速扩散语言模型解码的渐进细化调控
图9:渐进式自我演化与信任域正则化的效果。我们在不同监督更新策略下报告准确率随NFE的变化:一次性自我演化(100%)、混合比例为10%与1%的渐进式自我演化,以及不带信任域正则化的渐进式自我演化(1%)。每条曲线展示了在固定监督演化方案下得到的准确率–效率前沿。