论文

CORA-Diff:面向高效扩散语言模型推理的置信度导向残差接受

CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

模型推理推理加速

摘要

扩散语言模型(DLM)并行更新许多token,但实用解码器常使用固定的去噪步数。许多预测早早稳定下来,但分块解码仍要继续到所有位置被解析,造成重复的稠密前向传播。现有加速器通常依赖学习到的过滤器、修改的分数、依赖模型或缓存专用机制。我们问:原生轨迹信号能否识别那些很可能与确定性稠密终点一致的残余位置?我们提出CORA-Diff,一种免训练方法,它保留原始迁移规则,仅对该规则未能解析的位置施加置信度与持续性门控。被接受的token作为上下文保持可见,一旦所有位置被解析,块即终止。这不需要骨干改动、学习的接受模型或logit修改。我们的理论解释了为什么高置信、持续的预测更可能与固定步数的稠密终点一致,配对的干预后轨迹提供了直接的经验支持。我们在一个单独的GSM8K校准子集上选择一个工作点,并在所有评估中冻结它。在匹配的Learn2PD风格LLaDA协议下,CORA-Diff在全部八个任务-长度设置中实测运行时间最低。任务分数在五个设置中持平或超过稠密解码,观察到的最大下降为1.22分。相对EOS感知的稠密解码,其在GSM8K与HumanEval上的增量加速为2.70x与3.32x。在固定步数1024/1024的机制隔离协议下它还达到13.14x,并在不重调的情况下以3.18x-3.53x迁移到Dream。这些结果表明,原生置信度与持续性使可靠的残差接受成为可能,在保持任务质量的同时减少重复去噪计算。