论文
TS-Attn:用于多事件视频生成的时间可分离注意力
TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation
摘要
从包含多个连续动作的复杂时间描述生成高质量视频是一个尚未解决的关键问题。现有方法受到固有权衡的限制:使用顺序输入模型的多个短提示可以提高动作保真度,但会损害时间一致性,而单个复杂提示则以牺牲提示跟随能力为代价来保持一致性。我们将此问题归因于两个主要原因:1)视频内容和提示之间的时间错位,以及2)与运动相关的视觉对象及其相关文本条件之间的冲突注意耦合。为了应对这些挑战,我们提出了一种新颖的 无需训练 注意力机制,即时间明智的可分离注意力(TS-Attn),它动态地重新安排注意力分布,以确保多事件场景中的时间意识和全局一致性。 TS-Attn 可以无缝集成到各种预训练的文本转视频模型中,将 Wan2.1-T2V-14B 和 Wan2.2-T2V-A14B 上的 StoryEval-Bench 分数分别提高 33.5% 和 16.4%,而推理时间仅增加 2%。它还支持跨模型的即插即用使用,以生成多事件图像到视频。源代码和项目页面可在 https://github.com/hong-yu-Zhang/TS-Attn 获取。