论文

PhysElite:LLM距离解决奥赛级物理问题还有多远?

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

模型评测基准与评测资源

摘要

理解(多模态)大语言模型在物理问题上的表现,需要能反映专家级物理推理难度与广度的基准。现有物理基准在以下两个重要方面仍然有限:(1)缺乏高难度数据集;(2)缺乏对视觉形式、知识点和逐步解题过程的全面覆盖。因此,模型在现有数据集上的表现可能无法完全代表其解决复杂物理问题的能力。为解决这些问题,我们提出PhysElite,一个大规模双语多模态奥赛级物理推理基准。PhysElite包含11,586道奥赛级问题。对于每道题,我们提供相应的可视化图形、逐步的中英双语解题推导以及最终答案。我们对18个开源和闭源MLLM进行基准测试,发现即使最强的模型也只能达到33.7%的答案准确率。我们还进行了步骤级过程评估,以诊断模型在推理链中的失败位置。我们的数据集发布于https://huggingface.co/datasets/physelite/PhysElite。

PhysElite:LLM距离解决奥赛级物理问题还有多远?:论文配图
图1:PhysicsArena [1] 的两个现有K-12层级样例,与我们PhysElite中一个奥赛级物理问题示例的对比,后者带有解答步骤的详细多模态标注(对应的完整示例见图13)。