论文
视觉语言模型无法推理物理变换
Vision Language Models Cannot Reason About Physical Transformation
摘要
理解物理变换是动态环境中推理的基础。虽然视觉语言模型(VLM)在具体应用中显示出前景,但它们是否真正理解物理变换仍不清楚。我们引入了 ConservationBench 来评估守恒性——物理量在变换下是否保持不变。我们跨越 4 个属性以及配对的保守/非保守场景,在 112 个 VLM 中生成了 23,040 个问题。结果揭示了系统性失败:随着保护任务的改进以及控制的下降,性能仍然接近机会。对照实验显示,强大的文本先验有利于不变性,但模型在视觉内容方面表现较差。时间分辨率、提示或策划采样都无济于事。这些发现表明,当前的 VLM 无法在动态场景中保持物理属性的变换不变表示。
