论文
LaCache:扩散大语言模型的精确缓存与精度自适应推理
LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models
摘要
基于扩散的大语言模型(DLLM)经半自回归(SAR)解码实现并行文本生成。但当前方法存在严重的算子级冗余:去噪各步重算整个序列,无视块内前缀与被掩码后缀保持不变的事实。我们提出LaCache,一个免训练的加速框架,经无损缓存与混合精度缓解这一冗余。具体地,LaCache采用无损状态记忆化(LSM),缓存三类中间结果:(i)EmbedCache缓存嵌入输出,(ii)RoPECache缓存逐token的注意力前状态,(iii)FACache缓存FlashAttention内的在线softmax统计。这些缓存使模型跳过未变token上的冗余计算而不改变输出。为进一步缓解内存带宽瓶颈,LaCache为FFN层集成分组FP8量化策略,按扩散过程中依赖步数的激活分布定制。实验表明,LaCache本身即取得约1.3倍的端到端加速;与现有加速方法结合时,最高达40.2倍端到端加速且保持可比任务准确率。
