论文

Archer:自适应重用缓存隐藏状态以实现扩散语言模型中的高效回滚

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

模型推理KV Cache

摘要

扩散语言模型 (DLM) 迭代地细化序列,允许随着上下文的发展修改早期的预测。这种回滚功能将它们与不可逆的自回归生成区分开来,但使推理成本高昂。每次去噪更新都会改变全局上下文,强制重新计算提示和响应状态,即使只有响应词元是可修改的。键值 (KV) 缓存可以降低此成本,但传统缓存假设历史状态不可变,因此很难与回滚相协调。在本文中,我们介绍了自适应重用缓存隐藏状态以实现高效回滚(Archer),这是一种用于具有回滚功能的 DLM 的 无需训练 KV 缓存方法。 Archer 不对称地保持可变响应与当前假设同步,同时在有界状态邻域内重用提示 K/V。尽管提示表征在双向注意力下也会发生变化,但它们的标记身份仍然是固定的;因此,有界重用可以分摊重复的提示计算,而不缓存可变的响应状态。它还延迟来自暂定词元的反馈,减少暂时性高置信度错误的过早强化,并为回滚提供更多纠正这些错误的机会。我们的分析将即时重用描述为可逆性对齐的缓存边界,限制其状态相关的近似误差,并给出用于保留完全刷新决策的解码器裕度条件。现有的 DLM 加速通常会牺牲质量来换取速度。 Archer 改变了这一前沿,实现了 33.63% 的最佳平均性能,以及主套件的 2.57 倍平均加速。在评估的设置中,它使 Pass@1 提高了高达 3.05 个点,并实现了高达 2.95 倍的加速。受控分析将质量增益与延迟提示反馈联系起来并验证状态感知刷新。我们的代码可在 https://github.com/Hxnng/Archer 获取。