论文

SparSTAR:时空自回归视频合成的稀疏注意力

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

模型优化稀疏化

摘要

InfinityStar 通过一系列图像和剪辑金字塔将视觉自回归生成扩展到视频。然而,其不断变化的尺度和跨剪辑上下文使得后期关注成本高昂,并使从扩散或图像 VAR 模型中重用的稀疏模式变得不可靠。我们引入了 SparSTAR,这是一种针对此设置量身定制的 无需训练 块稀疏注意力方法。在每个昂贵的规模和注意力头上,SparSTAR 对当前查询和关键激活中的连续关键块进行评分,保留所需的条件上下文,并通过仅前向稀疏路径执行所选块。我们分析剪辑内的跨尺度一致性、跨剪辑边界的模式持久性,以及随着重用跨越越来越远的尺度而导致的质量下降。在这些分析中,重要的关键块发生了变化,表明在每个目标尺度上重新计算块选择比重用转移的掩模更可靠。在 720p 文本到视频和图像到视频生成中,SparSTAR 保留了每个标记和细化比例,同时提供约 1.6 倍的端到端加速,并保持接近密集 InfinityStar 的 VBench 和配对输出重建保真度。