论文
语言中的世界模型:审核视觉语言模型中的物理状态转换承诺
World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models
摘要
视觉语言模型 (VLM) 越来越多地用于回答有关物理场景的问题,但大多数评估都会降低最终答案的性能。这隐藏了模型是否感知了正确的物体、代表了正确的物理状态、预测了合理的转变,或者只是出于错误的原因选择了正确的选项。我们引入了 \wmw,一个用于审核 VLM 的 \emph{语言表达的物理承诺}的评估框架。我们要求模型生成类型化的跟踪 $I,q\mapsto(s_0,Δs,s_1,a)$,而不是仅对 $I,q\mapsto a$ 进行评分:初始状态、状态转换、结果状态和答案。然后,混合验证器检查模式有效性、状态基础、转换一致性和答案跟踪兼容性,生成类型化错误标签,例如对象、关系、力、转换、时间、单位/比例和 忠实性 错误。我们发布了 \tracebank,这是一种受控跟踪资源,具有 \n种子模式和重新计算验证的跨家庭物理族的合成场景,\n对受干扰最小的对比偏好对、验证程序代码、审计指南和模型输出进行配对。我们在受控和外部物理推理示例上评估模型 VLM。 \wmw 揭示了仅答案评估遗漏的失败:中间层模型中 35\% 的正确答案得到了物理无效痕迹的支持。验证者引导的重新排名可在不牺牲答案准确性的情况下恢复高达 7 个百分点的跟踪有效性,并且跟踪级别偏好调整可将隐藏的不一致相对减少 41%。该贡献不是另一个最终答案的物理基准,而是一个可重复使用的协议,用于测量 VLM 所陈述的物理世界是否可以与其答案同时真实。