论文
通过合成状态转换引导视频交互生成
Bootstrapping Video Interaction Generation with Synthetic State Transitions
摘要
虽然最近的视频生成模型可以合成高保真视频,但它们难以描绘合理的物理交互以及由此产生的状态转换,这是机器人和 VR/AR 应用的关键瓶颈。为了解决这个问题,我们引入了一个框架来生成可控交互的可扩展合成数据集。我们的管道利用结构化分类法和最先进的图像编辑模型来创建明确的“开始”和“结束”状态图像,作为交互的视觉锚点。为了利用这些锚点生成无缝视频,我们提出了状态引导采样(SGS),这是一种新颖的采样技术,可以减轻朴素条件生成中常见的伪影。此外,我们开发并验证了一种新的自动化评估系统,该系统与人类判断相一致,以确保数据质量。实验表明,在我们的数据集上微调基本模型可以显着增强其生成合理交互的能力。