论文

BilliardPhys-Bench:多模态LLM物理推理与视觉动态基准测试

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

模型评测基准与评测资源

摘要

当前多模态模型能很好地处理静态图像识别,但直觉性物理推理仍是短板。仅凭单张图像预测物体将如何运动与交互,对这些系统而言仍然困难。我们提出BilliardPhys-Bench,一个面向合成台球环境中物理推理的基准。其程序化引擎生成包含摩擦与弹性碰撞的随机化场景。该基准测试三种能力:(1)预测球与球之间的碰撞,(2)对墙壁反弹进行推理,(3)估计运动停止后各球的最终位置。我们评估了来自GPT、Claude、Gemini与Qwen系列的近期MLLM。随着模拟时间增加与场景几何变得更复杂,性能随之下降。我们还观察到一种一致的失败模式,称之为“停滞偏差”(stasis bias):当正确的物理结果较难推断时,模型倾向于预测不发生任何交互。这些发现揭示了当前MLLM在视觉动态上的失效之处,并指出多模态架构需要更好的物理归纳偏置。

BilliardPhys-Bench:多模态LLM物理推理与视觉动态基准测试:论文配图
图 1:BilliardPhys-Bench 数据生成管道。该管道分为三个阶段:(1)初始条件采样,随机化球位置和球杆速度; (2) 物理模拟,其中高保真引擎计算弹性碰撞和基于摩擦的减速,同时导出结构化注释; (3)可视化和统计,生成渲染图像和数据集分布报告。