论文

通过时空并行解码和置信度外推的高效扩散 LLM

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation

模型推理推理加速

摘要

基于扩散的 大语言模型 (dLLM) 通过迭代去噪支持并行文本生成,但推理仍然存在大量延迟,因为许多步骤都花费在冗余细化和对最​​终值已确定的标记的重复重新屏蔽上。先前的加速方法主要依赖于步局部置信启发法或固定时间表,它们对提示和任务变化敏感并且忽略序列内的强烈位置效应。我们将扩散解码视为动态控制问题,并表明标记式去噪轨迹为可靠控制提供了关键信号。我们提出了一个具有两个组件的跟踪感知解码框架。首先,时空并行解码(TSPD)使用轻量级时空控制器,该控制器消耗每个词元的轨迹特征,包括置信度、熵和动量以及词元位置,来决定词元何时收敛并可以安全地修复。其次,我们引入置信外推(CE),这是一个 无需训练 状态空间模块,可以预测未来的 logits 趋势,并具有不确定性,以支持主动决策,包括当轨迹振荡或信心不足时的安全前瞻和目标稳定。 TSPD 和 CE 共同减少了不必要的去噪迭代,同时保持输出质量,并且它们与 KV 缓存等系统优化完美结合。