论文
通过特定于实例的参数吸收实现内存高效的自回归视频生成
Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption
摘要
自回归 (AR) 流媒体模型已成为长视频生成的强大范例。然而,线性增长的键值(KV)缓存造成了严重的瓶颈,导致内存过载和推理吞吐量下降。一种常见的压缩方法是删除冗余的 KV 词元,这通常会破坏远程依赖性,导致时间闪烁和身份丢失。在本文中,我们提出了实例特定参数吸收(ISPA),这是一种将 KV 缓存压缩从丢弃转变为蒸馏的新颖框架。核心思想是通过将历史上下文“吸收”到模型的权重中,将层的子集从全注意力(F 层)过渡到内存高效的局部注意力(L 层)。具体来说,在短暂的预热阶段,ISPA 监控全局和本地注意力之间的输出差异。在过渡点,我们解决封闭式最小二乘问题来计算特定于实例的权重调制,以补偿缺失的历史记录。跨架构(1.3B 到 14B)的实验表明,ISPA 可以删除高达 50% 的 KV 缓存,并具有近乎无损的视觉质量。我们希望这个观点能够鼓励未来的工作,探索参数化内存整合,超越流生成模型的外部 词元级 缓存管理。