论文
MotionForesight:重新利用视频模型以实现未来 3D 场景流预测
MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction
摘要
人类可以通过被动观察来推断物体可能如何移动:杯子可以被举起,抽屉可以滑动,盖子可以旋转关闭。这些预测揭示了现实世界中行动所需的互动的物理后果。我们研究如何从人与物体交互的普通单眼视频中学习这种预期。给定一个简短的观察视频上下文,MotionForesight 可以预测被操纵对象上的点的未来 3D 轨迹。这将交互预测转化为以对象为中心的 3D 运动预测,而无需对对象属性进行任何假设。我们的主要见解是,视频预测模型已经编码了关于人类交互过程中物体如何移动的丰富先验知识。我们将这些先验从像素预测转向未来的 3D 场景流。我们从基于预训练视频模型构建的密集 3D 跟踪器开始,从完整的剪辑生成伪 真值 轨迹,并仅使用观察到的帧来训练预测器。我们用学习到的掩码潜伏替换未来的 RGB 和几何形状,并训练一个轻量级适配器将回顾性跟踪表示转变为前向预测器,同时冻结大型视频和跟踪组件。 MotionForesight 仅使用 40k 人类视频,没有语言等辅助输入,可以概括不同的分布外对象、环境、观点和交互。它还优于使用超过一百万个训练视频的更大模型。这些结果表明,我们可以有效地将视频先验重新用于具体智能的显式几何预测。 https://motionforesight.github.io/