论文
ShadowDancer:通过从视频及其阴影学习统一动态表示来教学视频世界模拟任何动作
ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
摘要
我们推出 ShadowDancer,这是一种对交互式视频世界模型进行任何动作、帧级控制的新颖方法。障碍是代表性的:现有的界面要么松散地对一个动作进行编码,让模型即兴发挥它的展开方式,要么通过为一个家庭服务且难以获取的结构化信号对其进行精确编码,因此对不同动态的精确控制仍然不切实际。演示视频是自然的补救措施,逐帧指定任何动态;然而,视频仅通过一种特定的外观(潜在动态的单一阴影)来显示其动态,因此从演示中学到的动作很难转移到新场景。 ShadowDancer 通过两项关键创新解决了这个问题:(1) 阴影对,即在独立重采样外观下重播相同动态的视频对,由我们的阴影库按比例构建,这样当可以为其构建此类对时,动态族就变得可以精确控制; (2)交叉阴影预测,它通过预测一个阴影和另一个阴影来学习动作,这样无论配对重采样的是什么,都会被构造丢弃,而保留下来的任何东西都会成为动作,从而产生驱动块因果世界模型的统一动态表示。因此,任何演示的剪辑都成为可重复使用的动作资产,可以在新环境中重播,无需动作标签、运动估计器或 微调。实验表明,在不同动态系列的强潜在动作和交互式世界模型基线上,动作转移和长程动作轨迹生成得到了改进,在生成轨迹比较中平均盲法获胜率为 86%。我们在 https://ShadowDancer-1.github.io 上显示视频结果