论文

LaCache:扩散大语言模型的精确缓存与精度自适应推理

LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models

模型推理推理加速

摘要

基于扩散的大语言模型(DLLM)经半自回归(SAR)解码实现并行文本生成。但当前方法存在严重的算子级冗余:去噪各步重算整个序列,无视块内前缀与被掩码后缀保持不变的事实。我们提出LaCache,一个免训练的加速框架,经无损缓存与混合精度缓解这一冗余。具体地,LaCache采用无损状态记忆化(LSM),缓存三类中间结果:(i)EmbedCache缓存嵌入输出,(ii)RoPECache缓存逐token的注意力前状态,(iii)FACache缓存FlashAttention内的在线softmax统计。这些缓存使模型跳过未变token上的冗余计算而不改变输出。为进一步缓解内存带宽瓶颈,LaCache为FFN层集成分组FP8量化策略,按扩散过程中依赖步数的激活分布定制。实验表明,LaCache本身即取得约1.3倍的端到端加速;与现有加速方法结合时,最高达40.2倍端到端加速且保持可比任务准确率。

LaCache:扩散大语言模型的精确缓存与精度自适应推理:论文配图
图 1:左图:DLLM 将总生成令牌拆分为连续的块,并在每个块内的多个步骤中进行并行解码。在一个区块的生成过程中,该区块之外的词元保持不变,这就导致了重复计算。右图:LLaDA-Instruct 中模块的延迟主要出现在转换器层和最终采样器处。使用我们的方法 LaCache,模块的延迟显着减少。