论文

Fast-dLLM++:用于更快扩散的 Fréchet 配置文件解码 LLM 推理

Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

模型推理批处理与并行

摘要

Diffusion 大语言模型 承诺并行词元生成,但通过决定哪些屏蔽词元可以安全地一起提交,推理仍然存在瓶颈。 Fast-dLLM 通过 KV 缓存和置信引导并行解码解决了这个问题,但其解码理论使用同质高置信度假设,有效地将每个候选集减少为其最弱的选定标记。我们认为这会影响速度,因为实际的解码步骤表现出异构的置信度。我们提出 \textbf{Fast-dLLM++},这是一个 无需训练 扩展,它引入了 \emph{Fréchet 配置文件解码}:从完整排序的置信度配置文件中选择并行提交集,而不是单个最坏情况的置信度。生成的规则是 Fast-dLLM 因子选择器的异质置信泛化,它在同等置信度情况下精确恢复先前的规则,并在所选标记具有不均匀置信度时添加可证明的 \emph{异质性奖励}。 Fast-dLLM++ 使模型、扩散过程和缓存实现完全不变,使其成为现有 Fast-dLLM 解码的直接替代品。使用 LLaDA-8B 模型对 GSM8K、MATH、HumanEval 和 MBPP 进行的实验表明,理论改进可直接转化为经验收益:配置文件感知选择通过利用最弱词元规则错过的安全并行性来提高准确性 - 吞吐量前沿,在相当的准确性下实现高达 37% 的吞吐量提高。我们的代码发布地址为 https://github.com/Ringo-Star/FastdLLM_plusplus。