论文
PhysVista:通过感知-推理-评估循环对 VLM 中的物理智能进行基准测试
PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop
摘要
视觉语言模型(VLM)显示出强大的多模态推理能力,但它们是否真正捕捉到现实世界动态背后的物理一致性仍不清楚。现有的基准范式常常遭受碎片化的评估,专注于孤立的认知阶段,而忽视了感知、推理和物理判断之间固有的协同作用。缺乏整体视角限制了诊断 VLM 是否能够可靠地评估新兴生成模型的物理真实性的能力。为了解决这些问题,我们推出了 PhysVista,这是一个基准测试,旨在通过受人类视觉推理评估过程启发的封闭认知循环框架来评估 VLM 中的身体智能。 PhysVista 通过联合评估物理状态感知、物理动力学推理和物理合理性评估来恢复这一循环。它进一步区分了事件级推理和尺度级推理,以实现物理理解的细粒度分析。此外,PhysVista 结合了现实世界和人工智能生成的视频,允许跨不同领域和新兴生成场景进行评估。各种 VLM 的广泛实验揭示了物理推理和合理性评估的巨大局限性,凸显了视觉识别和真正的物理理解之间持续存在的差距,并指出了基于物理的多模态智能的更有原则的设计。