论文

FeynmanBench:评测多模态LLM的图示物理推理

FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning

模型评测基准与评测资源

摘要

前沿理论的突破往往依赖于具体的图表符号与严密逻辑的结合。虽然多模态大语言模型 (MLLM) 在一般科学任务中显示出前景,但当前的基准通常侧重于局部信息提取,而不是形式科学符号中固有的全局结构逻辑。在这项工作中,我们介绍了 FeynmanBench,这是第一个以费曼图任务为中心的基准测试。它旨在评估人工智能的多步骤图解推理能力,这需要满足守恒定律和对称约束、识别图拓扑、图解和代数表示之间的转换,以及在特定约定和规范下构造散射振幅。为了支持大规模和可重复的评估,我们开发了一个自动化管道,可以生成各种费曼图以及可验证的拓扑注释和振幅结果。我们的数据库涵盖标准模型的电磁相互作用、弱相互作用和强相互作用,涵盖 100 多种不同类型,包括 2000 多个任务。最先进的 MLLM 实验揭示了系统性故障模式,包括物理约束的不稳定执行和全局拓扑条件的违反,凸显了基于物理的基准对科学计数法进行视觉推理的需要。 FeynmanBench 提供了逻辑上严格的测试,测试人工智能是否能够有效地参与科学发现,特别是在理论物理学领域。

FeynmanBench:评测多模态LLM的图示物理推理
图 1. FeynmanBench 的工作流程。前四个面板处理费曼图和相关物理信息的生成。第五阶段应用费曼规则来导出相应的散射幅度。最后阶段实施自动评分模块,根据理论基础事实评估模型性能