论文
本地参与,线性记忆:线性注意力作为自回归视频扩散的跨帧记忆
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
摘要
自回归 (AR) 视频扩散是流媒体和交互式视频生成的强大范例。然而,由于键值缓存,它对 softmax 自注意力的依赖导致序列长度和内存使用的二次计算复杂性,这限制了其对长视频范围的可扩展性。现有的补救措施(例如,稀疏注意力和 KV 缓存压缩)降低了每步成本,但仍然依赖于线性增长的缓存或不可逆地丢弃过去的上下文,因此无法解决线性内存增长和流式上下文管理问题。为了解决这个可扩展性瓶颈,我们提出了 ARL2(本地参与,线性记忆),这是一种混合注意力模块,用固定大小的循环状态代替二次跨帧注意力。我们将自注意力分解为两个分支:一个用于空间细节和局部依赖性的帧内 softmax 分支,以及一个为流上下文维护固定大小状态的帧间门控循环线性分支。我们的主要见解是,softmax 注意力捕获细粒度的局部交互,而循环状态提供可控的远程记忆。该设计实现了具有恒定内存的线性时间缩放,同时提高了全 softmax 模型的时间一致性。为了防止嘈杂的中间状态破坏内存,我们仅在去噪过程之后更新循环状态。为了避免帧内信息不对称,所有词元共享相同的更新前状态而不是顺序更新。据我们所知,这是第一个通过 AR 视频的高效两阶段训练方案将预训练的 AR 视频扩散模型转换为混合线性注意力架构的工作。通过混合线性注意力替换 75% 的层,该模型实现了高达 2.26 的挂钟加速和 54% 的内存减少,同时保持可比较的质量并提高了时间一致性。