论文

前沿模型在物理问题上的表现如何?专家重新评分揭示了评估缺陷及领先基准的接近饱和

How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks

模型评测模型能力评测

摘要

在多个主流物理基准测试中报告的低分,包括2026年《人工分析智能指数》中涉及的测试,表明前沿语言模型在高级物理问题上仍存在困难,这考验了其科学推理和定量问题解决能力。然而,这一印象并不总是符合领域专家在实际工作中使用这些模型的体验。我们重新评估了这些模型在六个广泛使用的物理基准上的表现,并邀请专家进行审计,重点针对仅需文本输入且有可验证最终答案的问题。针对物理学各子领域,具备相关背景的教师和研究生仔细审查了问题陈述、参考解答和模型响应,以区分模型本身的物理推理错误、评分者错误、参考解答错误以及问题表述模糊或不明确的情况。大多数最初被判定为错误的案例,实则源于基准测试中的问题,而非模型在物理推理上的缺陷。随后,专家通过修正错误的参考解答或修复/排除有缺陷的问题来解决这些基准问题。我们发现,GPT-5.6-Sol在HLE-Physics上的mean@4从47.3%提升至78.7%,在CMT-Benchmark上的mean@4从61.0%提升至87.2%;其在修正后的54个保留的CritPt挑战中,pass@4达到94.4%。所有修正后的分数均基于专家审核后保留的评估子集计算。在经过专家审核后,UGPhysics、PRISM-Physics和PHYBench的审计子集分数也显著提升。这些结果表明,当前基准严重低估了前沿模型解决明确物理问题的能力。在这些封闭式任务上接近饱和,凸显了需要更严格、由专家验证的评估方式。