论文
PhysMind:从视频到 无需训练 物理推理的可执行世界
PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning
摘要
通过视频进行可靠的物理推理需要了解物体如何移动、交互以及对干预的响应。现有的视觉语言模型 (VLM) 通常难以解释这些动态并可靠地推理未来和反事实的结果。我们介绍 PhysMind,这是一种 无需训练 代理框架,它为每个视频构建一个可重用、与问题无关的可执行世界。 PhysMind 通过对象分割、网格重建和 6D 姿态跟踪恢复时间一致的动态场景,然后拟合分析连续时间动态和潜在物理参数,而无需展开时间步进模拟器。给定一个问题,它会检查、继续或编辑世界,并根据产生的轨迹和交互给出答案。相对于使用相同 VLM 的直接思想链 (CoT) 推理,PhysMind 在 CLEVRER 上的准确性提高了 38.23 分,在 Physion++ 上提高了 8.08 分。在反事实问题上,它超出了最强评估的 VLM 基线 GPT-5.5 19.25 分。