论文

ProxyUp:用于可控动态的 无需训练 代理条件视频生成

ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics

模型推理解码与生成控制

摘要

对于现代视频生成模型来说,对复杂动态的精确控制仍然具有挑战性,因为单独的文本提示通常无法指定物理上合理的、细粒度的运动和交互。我们引入$\textit{代理条件视频生成}$,其中来自基于物理的模拟或现实世界记录的粗代理视频用作控制前景对象运动的动态载体。给定代理视频和文本提示,目标是合成一个新视频,保留代理动态,同时生成与提示一致的新颖内容和合理的交互。由于配对的代理目标视频很难获得,我们提出 $\textbf{ProxyUp}$,一个基于预训练视频生成模型构建的 无需训练 框架。 ProxyUp 首先将代理视频反转为中间潜在表示,并应用 $\textbf{region-wise 潜在噪声}$,保留运动关键代理潜在,同时将噪声注入用于文本驱动再生的区域。为了减轻这种启发式潜在组合引入的分布失配和弱前景-背景耦合,我们进一步提出 $\textbf{Stochastic Flow Relaxation (SFR)}$,它在 ODE 采样之前逐步将组合潜在放松到模型的学习分布。对模拟和现实世界代理的实验表明,ProxyUp 在动态保真度和文本对齐方面优于强大的视频编辑和运动传输基线。