论文
$Δ$ynamics:用于从视频推断刚体动力学的基于语言的表示
$Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
摘要
从单目视频推断刚体物理状态和属性是迈向基于物理的感知和模拟的基本一步。现有方法假设特定的底层物理系统、对象类型和相机姿势,使得它们无法推广到复杂的现实世界设置。我们引入$Δ$YNAMICS,一个视觉语言框架,它使用语言作为刚体动力学的统一表示。 $Δ$YNAMICS 不是直接预测参数,而是以结构化文本格式生成场景配置以进行物理模拟。我们通过集成自然语言运动推理并利用光流作为语义不可知的输入来增强模型的泛化能力。在 CLEVER 数据集上,$Δ$YNAMICS 的分割 IoU 为 0.30,比领先的 VLM(InternVL3-8B、Qwen2.5-VL-7B 和 Claude-4-Sonnet)提高了 7 倍。此外,测试时采样和进化搜索在分割 IoU 方面的性能分别进一步提高了 27% 和 120%。最后,我们展示了向包含 235 个真实世界刚体视频的新数据集的强大迁移,强调了语言驱动的物理推理在连接感知和模拟方面的潜力。