论文
QWERTY:无需训练 通过查询扭曲视频扩散进行运动控制 Transformer
QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers
摘要
视频扩散 Transformer (DiT) 生成高保真且时间连贯的视频,但运动控制仍然是隐式的,主要依赖于文本提示。因此,实现所需的运动通常需要大量的即时工程和重复的重新采样。虽然具有附加空间提示(例如边界框或点轨迹)的 微调 模型可以实现显式控制,但它需要大量的数据管理和计算,并且可能会损害预训练模型的生成能力。因此,使用此类空间提示的 无需训练 运动控制已在基于 U-Net 的视频扩散模型中进行了探索,但对于 DiT 来说仍然很大程度上尚未探索。我们引入了 QWERTY,这是一个 无需训练 框架,可通过用户定义的对象变形和光流在预训练的图像到视频 DiT 中实现灵活的运动控制。我们通过扭曲查询的帧不变语义子空间来小心地操纵 DiT 的 3D 全注意力。我们发现,查询扭曲 DiT 预测的噪声自然地将扩散轨迹引导向所需的运动,并进一步表明,利用这种噪声作为潜在优化的自我指导可以提高控制稳定性和视觉质量。实验表明,QWERTY 在最近的图像到视频 DiT 上实现了现有 无需训练 方法中最有效的运动控制,其性能与基于 微调 的方法相当。