论文

TokenDial:视觉表盘空间中文本到视频生成的连续属性控制

TokenDial: Continuous Attribute Control for Text-to-Video Generation in Visual Dial Space

应用与实践内容创作

摘要

在视频扩散Transformer中,视觉补丁标记保持与空间和时间的明确对应。我们假设它们的通道维度可以作为语义控制空间,我们称之为视觉拨号空间V+。在这个空间中,可以将附加方向广播到词元流以控制外观或运动属性,从而实现滑块式编辑,例如使生成的人看起来更老或跑得更快。为了验证这一假设,我们提出了 TokenDial,一个用于在所提出的 V+ 空间中学习属性方向的框架。 TokenDial 保持预训练视频生成器冻结并仅优化附加方向。 TokenDial 不需要配对编辑的视频,而是通过其对生成视频的诱导效果来监督每个方向:编辑的视频应沿着所需的属性移动,而其余内容保持稳定。学习到的方向成为可重复使用的视觉刻度盘,支持连续的外观和运动控制、明确的时空定位、合成以及跨提示、分辨率和视频长度的重复使用。实验和人体研究表明,与之前的视频编辑和基于滑块的方法相比,TokenDial 实现了更强的滑块可控性和更好的内容保存。