论文

OpenProblemBench:以82个未解理论科学问题测试AI

OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences

模型评测应用与实践基准与评测资源科学研究

摘要

通用人工智能的下一个前沿是解决未解决的科学问题,需要建立评估现有知识之外的进展的基准。我们介绍 OpenProblemBench,这是从数学和理论物理文献中提取的 82 个未解决问题的基准。每个问题都提供了研究该问题所需的研究背景、假设和先前进展。我们选择的问题所提出的解决方案可以对其决定性的数学或计算主张进行相对清晰的检查。四个评估器模型独立评估每个提交的正确性、完整性和进展程度,无需参考解决方案。在七种评估配置中,GPT-6-Astra 实现了 14.0% 的最高平均判定解决率,而评估的全尺寸开放模型为 5.5-6.7%,Flash 模型为 2.4-3.7%。案例比较将更强有力的结果与问题表示的变化、超出有限证据的一般论点以及完成解决方案所需步骤的证明联系起来。通过接地 OpenProblemBench 为研究文献中出现的问题进行评估提供了一个环境,用于研究人工智能作为基础理论科学贡献者的能力和局限性。