论文

Polestar:漂移感知缓存校准和词元承诺,用于有效的扩散推理 LLM

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs

模型推理KV Cache

摘要

扩散 大语言模型 (dLLM) 的推理效率受到两个挑战的限制:双向注意力阻碍了有效的 KV 缓存重用,而使用静态置信阈值增加解码并行性可能会损害生成质量。我们观察到,这两个挑战都源于一个共同的现象:当词元被解码时,它们通过双向注意力的上下文整合导致词元表示在解码步骤中漂移(进化)。这种见解激发了 Polestar,这是一个 无需训练 推理框架,它使用词元表示漂移作为统一信号来共同应对这两个挑战。 Polestar 由两个组件组成:Polestar-Cache,它通过漂移识别过时的 KV 缓存位置,并执行稀疏 KV 缓存刷新以实现高效重用;Polestar-Commit,它检测急剧漂移事件以可靠地识别提交就绪词元。在多个 dLLM 系列的数学和编码基准中,Polestar 在准确性吞吐量 Pareto 前沿上树立了新的技术水平,与现有基线相比,准确性提高了 10.73%,吞吐量提高了 3.7 倍,并且每次前向传递 3.67 个词元的高解码并行度。