论文

超越静态视觉:场景动态场解锁多模态中的直观物理理解 大语言模型

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

模型评测基准与评测资源

摘要

虽然多模态 大语言模型 (MLLM) 在图像和视频理解方面表现出了令人印象深刻的能力,但它们理解物理世界的能力已成为越来越重要的研究焦点。尽管有所改进,当前的 MLLM 在高级物理推理方面仍存在很大困难。在这项工作中,我们研究了物理推理的第一步,即直观的物理理解,揭示了理解连续体物体动力学的实质性局限性。为了隔离和评估这种特定功能,我们引入了两个基本基准测试任务:下一帧选择(NFS)和时间相干性验证(TCV)。我们的实验表明,即使是最先进的 MLLM 在这些基础任务上也表现不佳。为了解决这一限制,我们提出了场景动态场(SDF),这是一种在多任务 微调 框架内利用物理模拟器的简洁方法。 SDF 显着提高了性能,在流畅的任务上实现了高达 20.7% 的提升,同时对看不见的物理领域表现出强大的泛化能力。这项工作不仅凸显了当前 MLLM 的关键差距,而且还为开发更多具有物理依据的 MLLM 提供了一种有前途的经济高效的方法。我们的代码和数据可在 https://github.com/andylinx/Scene-Dynamic-Field 获取。