论文

视觉语言模型无法推理物理变换

Vision Language Models Cannot Reason About Physical Transformation

模型评测基准与评测资源

摘要

理解物理变换是动态环境中推理的基础。虽然视觉语言模型(VLM)在具体应用中显示出前景,但它们是否真正理解物理变换仍不清楚。我们引入了 ConservationBench 来评估守恒性——物理量在变换下是否保持不变。我们跨越 4 个属性以及配对的保守/非保守场景,在 112 个 VLM 中生成了 23,040 个问题。结果揭示了系统性失败:随着保护任务的改进以及控制的下降,性能仍然接近机会。对照实验显示,强大的文本先验有利于不变性,但模型在视觉内容方面表现较差。时间分辨率、提示或策划采样都无济于事。这些发现表明,当前的 VLM 无法在动态场景中保持物理属性的变换不变表示。

视觉语言模型无法推理物理变换
图2:ConservationBench 上的总体性能。A. 在守恒任务与不守恒对照上取平均的准确率,与严格成对计算相比较(Top 30模型;完整结果见附录H);B. 不守恒对照上的性能与守恒任务表现的关系。