论文

TPD:文本到视频扩散模型的时间先验解耦

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

模型推理解码与生成控制

摘要

文本到视频的扩散模型从自然语言中生成时间连贯的内容,然而,当提示描述了一个持续存在的早期场景,而一个新事件出现在其之上时——例如“一座高大的沙堡矗立在海滩上,海浪冲进来并将其冲走”——生成经常无法意识到相应帧中的后期事件。我们将这种失败称为时间先验抑制(TPS):早期片段的主导先验捕获了跨时间轴的交叉注意力轨迹,并抑制了后期片段实现所需的引导信号,这是现有引导机制无法建模的竞争趋势。我们引入了时间先验解耦 (TPD),这是一种 无需训练 框架,可在扩散采样期间恢复受抑制的后期信号。 TPD 通过仅对早期片段进行调节来构建时间反事实,并将完整提示轨迹和反事实轨迹之间的差异定义为抑制信号方向。 TPD 并没有像之前的减法投影方法那样删除这个方向,而是通过在扩散时间步长和视频帧上联合解决的帧选择性下界约束来恢复它,在不破坏早期片段一致性的情况下实现后期帧中的抑制事件:先前的工作强制上限可行性以删除不需要的语义,TPD 强制执行下限可行性以保证抑制信号的贡献。 TPD 完全在标准扩散采样内运行,无需重新训练,并且纯粹在无分类器的指导空间中定义,使其在结构上与骨干网无关。实验表明,TPD 显着改善了后期概念的实现,同时保留了时间连贯性和视觉保真度,并且目标抑制在不同的文本到视频主干上重复出现。