论文
视频 DeltaNet:用于直播视频生成的视频原生混合注意力
Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
摘要
视频扩散模型在去噪过程中重复处理长时空标记序列,使得注意力成为主要的计算瓶颈。线性注意力提供了一种有吸引力的替代方案,并在最近的大型语言模型中得到了广泛采用,但将其直接应用于视频模型通常无法保留高质量生成所需的细粒度交互。我们提出了 Video DeltaNet (VDN),它将局部 Softmax 注意力与用于远程视频上下文的双向线性存储器相结合。它的线性分支引入了视频增量注意力(VDA),它通过联合合并其空间标记来每帧更新一次内存。单独的输出投影和可学习的门校准两个分支,而分阶段的教师对齐方法逐步将新路径引入预训练模型中。我们在 MiniMax H3 上实例化 VDN,将混合应用到视频到视频交互,同时保留 Softmax 进行涉及文本或音频的交互。借助八步蒸馏和优化的 SGLang 服务堆栈,VDN-H3 在 8 个 NVIDIA B200 GPU 上用 6.70 秒完成了 14.3 秒、768p 视频的 DiT 去噪,相当于在相同 GPU 数量上比 50 步密集 H3 基线提高了 14.5 倍。