论文
GraphVid:交互式图形可控视频生成
GraphVid: Interactive Graph-Controllable Video Generation
摘要
由于使用主要限制像素移动的文本提示或运动控制输入来指定精确的多对象交互非常困难,因此可控视频生成仍然具有挑战性。在实践中,基于轨迹的控制通常要求用户为多个对象绘制准确的轨迹,这随着场景复杂性的缩放而变化,并且在遮挡或重叠的情况下变得模糊。为了实现灵活而精确的多主体控制,我们引入了 $\textbf{GraphVid}$,这是一种图条件图像到视频生成模型,可通过结构化交互图实现交互控制。我们进一步策划了 $\textbf{GraphVid-Bench}$,这是一个以交互为中心的大规模视频数据集,具有结构化关系注释,可以训练交互感知视频生成模型。尽管与之前的运动控制方法相比,使用的训练数据和可训练参数要少得多,但 GraphVid 仍提供了强大的可控性和视频质量。与Motion-I2V相比,GraphVid将FID降低高达39.9%,将FVD降低37.6%,同时提高PSNR(9.87=>15.98)和SSIM(0.38=>0.61)。我们的结果凸显了结构化语义接口作为可控视频生成的强大范例的潜力。