论文

PhysFieldBench:多模态模型可以理解物理场吗?

PhysFieldBench: Can Multimodal Models Understand Physical Fields?

模型评测模型能力评测

摘要

多模态大语言模型(MLLM)越来越多地被视为科学和工程Agent的核心组成部分,但它们解释物理场的能力仍然知之甚少。现有的物理基准在很大程度上强调教科书上的问题解决或直观的物理推理,而 MLLM 是否可以从连续的现场观察中推断出物理上有意义的信息仍是未知数。我们引入了 PhysFieldBench,这是一个包含 24 个任务和 1,160 个评估示例的基准,涵盖受控方程场、模拟物理场和观测物理场。这些任务评估三种形式的推理:识别物理机制、比较潜在控制变量和预测结果属性。在代表性的开源和专有 MLLM 中,零样本性能较低:最好的模型达到了 29.3 的机会归一化分数,而几个开源模型仍然接近机会。相比之下,特定任务的监督视觉转换器的表现要好得多,证明输入包含可学习的物理信息。为了诊断这些故障,结构化的自我解释分析将大多数错误归因于错过的视觉模式和不正确的视觉到物理映射。此外,为了探索训练后是否可以改善物理推理并推广到未见过的任务,我们将监督微调与最终答案或思维链监督和强化学习进行比较。最终答案监督总体表现最好,但迁移效率较低,而思维链监督后的强化学习实现了最好的泛化。总之,这些发现强调需要改进 MLLM 的视觉到物理基础和跨任务泛化,以便可靠地解释科学和工程工作流程中的物理场。