论文
StrucPhysVideo:从结构化字幕和机器人动作中学习物理动力学
StrucPhysVideo: Learning Physical Dynamics from Structured Captions and Robot Actions
摘要
物理动力学建模,包括对象如何移动、交互和改变状态,是具体人工智能视频世界模型的核心。我们推出了 StrucPhysVideo,这是一系列视频世界模型,它将以物理为中心的数据管理与场景演变的语言和动作条件预测联系起来。我们的数据管道将运动感知视频分割、质量和内容过滤以及物理相关性验证与对象、材料和时间局部交互的结构化注释相结合。通过将摄像机运动与对象行为分开并明确描述接触、变形和状态转换,该管道提供了基于可观察物理事件的监督。基于这些数据,我们引入了 StrucPhysVideo-TI2V,这是一种稀疏专家混合 (MoE) 文本图像到视频模型,通过课程进行训练,逐步强调物理动力学,同时保留通用领域视频数据。 StrucPhysVideo-TI2V 在Physics-IQ Verified 上实现了最先进的性能,得分为 45.5%,比 Cosmos3-Super-Image2Video 高出 2.8 个百分点。跨主干网的字幕消融进一步证明了以物理为中心的监督的有效性。我们进一步将 StrucPhysVideo-TI2V 扩展为 StrucPhysVideo-IA2V,这是一种交互式图像-动作-视频世界模型,可预测机器人末端执行器命令的视觉结果。动作调节、因果自回归生成和少步蒸馏使得增量机器人轨迹生成仅需四个降噪步骤。 StrucPhysVideo 共同推进物理动力学建模,从图像和语言调节的视频预测转向动作驱动的交互。