论文

DiscoverPhysics:对 LLM 进行开箱即用的科学思维基准测试

DiscoverPhysics: Benchmarking LLMs for Out-of-the-Box Scientific Thinking

模型评测基准与评测资源

摘要

Frontier LLM 现在在广泛的物理评估中表现强劲,但很难将真正的推理与对既定科学的回忆分开。我们引入了 DiscoverPhysics,这是一个交互式基准测试,要求 LLM 代理发现模拟世界的运动定律,该模拟世界的物理特性故意偏离我们的物理定律。我们构建了 22 个世界,这些世界受屏蔽和分数幂引力、多物种耦合、隐藏的类暗物质粒子、非无坐标物理和时变相互作用等控制。每个世界都是由 N 体模拟器按需生成的,代理提出多轮实验,观察原始轨迹数据,并最终提交世界物理的自然语言解释和推断定律的 Python 实现。因为解决一个世界需要智能体设计信息丰富的实验并修改其假设,所以基准测试探索了实验历史的长期推理。我们沿着两个互补的轴评估提交的内容:保留粒子的轨迹 MSE 和 LLM 判断的解释分数,遵循专家编写的评估每个世界概念理解的标准。在十一个前沿模型中,我们发现最强大的智能体只能通过一半的世界,并且在那些必须揭示潜在结构的世界上始终失败。开源模型在设计信息丰富的实验和从数据中提取结论的能力方面都远远落后于商业模型。我们进一步发现,良好的预测准确性并不能保证高的解释质量,并且概念理解依赖于通过精心选择的实验对假设进行细化。