论文

新证据,相同选择:在视觉语言模型中测试物理实验选择

New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models

模型评测基准与评测资源

摘要

模型首先看到来自一个物理测量实验的图像,例如一个块滑行了多远,并且必须回答有关新试验的问题,例如该块在固定推动后是否会通过目标。初始实验可能提供足够的信息来回答,或者模型可能需要其他测量,例如物体的质量、摩擦力、恢复力或弹簧刚度。我们研究视觉语言模型是否可以决定何时立即回答,以及何时需要更多证据,进行哪个实验。目前的物理推理基准通常只评估最终答案,因此它们并不直接衡量这种决策能力。我们引入了一种受控评估,其中每个问题提供一个测量图像和通过组合两个可能的质量和另一个相关属性的两个可能值创建的四个可能的物理世界。模型必须停止并回答,或者选择能够解决问题的最便宜的附加实验。我们构建匹配的问题对,其中改变观察到的测量或问题会改变最佳行动。由于所有可能的世界和实验成本都是已知的,我们可以明确地确定最佳选择。在 6 个开放模型和 144 个物理参数集中,即使正确的动作发生变化,直接响应也会对 95.1% 到 100% 的图像对重复相同的动作。简短推理可以改善动作切换,但最佳模型仅对 5.9% 的图像对做出正确的两个决策。额外的分析揭示了测量解释、物理推理和响应格式方面的失败。通过将证据选择与最终答案分开评估,我们的基准揭示了传统答案准确性可能忽略的物理推理的局限性。