论文

PRL-Bench:评估LLM前沿物理研究能力的综合基准

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

模型评测基准与评测资源

摘要

主体科学的范式要求人工智能系统能够进行稳健的推理并进行长期的自主探索。然而,当前的科学基准仍然局限于领域知识理解和复杂推理,未能评估现实世界研究的探索性和程序复杂性。在这项工作中,我们提出了理论和计算物理领域以研究为导向的评估,这是一个具有全面领域知识、复杂推理和可验证的端到端工作流程的自然测试平台,无需依赖实验。在这里,我们介绍 PRL-Bench(LLM 的物理研究),这是一个基准测试,旨在系统地映射 LLM 在执行端到端物理研究中的能力边界。 PRL-Bench 由 2025 年 8 月以来最新一期《物理评论快报》中的 100 篇精选论文构建而成,并经过领域专家的验证,涵盖了现代物理学的五个主要理论和计算密集型子领域:天体物理学、凝聚态物理学、高能物理学、量子信息和统计物理学。基准测试中的每项任务都旨在复制真实科学研究的核心属性,包括探索型公式、长期工作流程和客观可验证性,从而重建真实物理研究的基本推理过程和研究工作流程。跨前沿模型的评估表明,性能仍然有限,最好的总体得分低于50,揭示了当前LLM能力与真实科学研究需求之间的明显差距。 PRL-Bench 为下一代 AI 科学家提供了一个可靠的测试平台,推动 AI 系统走向自主科学发现。