论文
BilliardPhys-Bench:多模态LLM物理推理与视觉动态基准测试
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
摘要
当前多模态模型能很好地处理静态图像识别,但直觉性物理推理仍是短板。仅凭单张图像预测物体将如何运动与交互,对这些系统而言仍然困难。我们提出BilliardPhys-Bench,一个面向合成台球环境中物理推理的基准。其程序化引擎生成包含摩擦与弹性碰撞的随机化场景。该基准测试三种能力:(1)预测球与球之间的碰撞,(2)对墙壁反弹进行推理,(3)估计运动停止后各球的最终位置。我们评估了来自GPT、Claude、Gemini与Qwen系列的近期MLLM。随着模拟时间增加与场景几何变得更复杂,性能随之下降。我们还观察到一种一致的失败模式,称之为“停滞偏差”(stasis bias):当正确的物理结果较难推断时,模型倾向于预测不发生任何交互。这些发现揭示了当前MLLM在视觉动态上的失效之处,并指出多模态架构需要更好的物理归纳偏置。
