论文

PRBench:物理研究中的端到端论文复制

PRBench: End-to-end Paper Reproduction in Physics Research

智能体系统Agent任务评测

摘要

大语言模型支持的AI智能体表现出强大的推理和解决问题的能力,使其能够协助公式推导和代码生成等科学研究任务。然而,这些代理是否能够可靠地从真实的科学论文中执行端到端复制仍然是一个悬而未决的问题。我们推出 PRBench,这是涵盖 11 个物理子领域的 30 项专家策划任务的基准。每项任务都需要代理理解已发表论文的方法论,从头开始实现相应的算法,并产生与原始出版物相匹配的定量结果。代理仅获得任务指令和论文内容,并在沙盒执行环境中运行。所有任务均由来自北京大学物理学院 20 多个研究小组的领域专家贡献,每个任务均以真实发表的论文为基础,并通过经过验证的 真值 结果和详细评分标准进行端到端复制进行验证。使用代理评估管道,我们在 PRBench 上评估一组 编码智能体 并分析它们在科学推理和执行的关键维度上的能力。表现最好的代理是由 GPT-5.3-Codex 提供支持的 OpenAI Codex,平均总分达到 34%。所有代理的端到端回调成功率为零,在数据准确性和代码正确性方面表现尤其差。我们进一步识别系统故障模式,包括公式实现中的错误、无法调试数值模拟以及输出数据的伪造。总体而言,PRBench 为评估自主科学研究的进展提供了严格的基准。