论文
通过推理时间指导生成合成视频
Compositional Video Generation via Inference-Time Guidance
摘要
文本到视频的扩散模型生成逼真的视频,但通常无法满足需要细粒度构图理解的提示,例如实体、属性、动作和运动方向之间的关系。我们假设这些故障不需要通过重新训练生成器来解决,而是可以通过使用模型自身的内部时空对应信号控制去噪过程来减轻。我们提出了 \textbf{CVG},一种推理时间指导方法,用于改进冻结文本到视频模型中的组合 忠实性。我们的主要观察结果是,交叉注意力图已经编码了提示概念如何跨空间和时间扎根。我们在这些注意特征上训练一个轻量级的合成分类器,并在早期的去噪步骤中使用它的梯度来引导潜在轨迹走向所需的合成。该分类器建立在冻结的 VLM 主干上,可以跨语义相关的组合标签进行传输,而不是仅依赖于狭窄的特定类别特征。 CVG 改进了组合生成,无需修改模型架构、生成器 微调,也不需要布局、框或其他用户提供的控件。组合文本到视频基准的实验表明,提示 忠实性 得到了改进,同时保留了底层生成器的视觉质量。