论文

测试前沿 大语言模型 平行物理世界中的物理素养

Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds

模型评测基准与评测资源

摘要

当前的大语言模型 (LLM) 物理基准通常通过答案准确性进行评分,这无法区分真正的推理与对熟悉问题模式的回忆,并且几乎无法揭示模型推理的失败之处。我们引入了可审计的四阶段诊断,用于评估 LLM 是否可以通过归纳、公式化、预测和审查在不熟悉的物理框架内进行推理。该诊断结合了锁定的预注册、阶段之间的新会话、双 LLM 判断和人工审核路径,我们将其应用于三个平行的物理世界:单方程反事实世界($F=mv$)、历史框架(亚里士多德力学)和四域反事实世界(衰变世界)。在 Claude Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro 中,三个世界的综合 PASS 率分别为 6/15、6/15 和 0/15(内容 $\land$ 结构为 $F=mv$ 和亚里士多德式,内容轴仅适用于结构轴超出范围的 Decay World)。最尖锐的经验模式是定性与定量的不对称:在《衰变世界》中,模型几乎从不预测错误的变化方向,但经常通过退回到标准物理关系来计算错误的比率。该协议还提出了两个方法论发现:LLM 判断可靠性不会跨框架转移,并且每个框架中的第 4 阶段自我审查都很薄弱,模型自己的审查错误地报告了至少三分之二实际包含错误的试验中没有早期错误。我们发布完整的提示、答复、判决和审计记录。