论文

SciPredict:LLM能否预测自然科学的实验结果?

SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?

模型评测基准与评测资源

摘要

加速科学发现需要在投入昂贵物理验证之前,先识别哪些实验会带来最佳结果。现有基准大多评估LLM的科学知识与推理能力,而其预测实验结果的能力——一项AI可能显著超越人类的任务——在很大程度上仍未被充分探索。我们提出SciPredict,一个包含405个任务的基准,这些任务源自物理学、生物学与化学33个专业子领域的近期实证研究。SciPredict回答两个关键问题:(a) LLM能否以足够的准确度预测科学实验的结果?(b) 此类预测能否可靠地用于科学研究流程?评估在两方面都揭示了根本局限。模型准确率为14-26%,人类专家表现约为20%。尽管部分前沿模型超过了人类表现,模型准确率仍远低于能够支撑可靠实验指导的水平。即便在这一有限性能之内,模型也无法区分可靠预测与不可靠预测:无论置信度高低,或是否判断结果无需物理实验即可预测,其准确率都只有约20%。相比之下,人类专家表现出很强的校准性:随着他们判断结果在不做实验的情况下越可预测,其准确率从约5%升至约80%。SciPredict建立了一个严格的框架,表明要在实验科学中达到超越人类的水平,不仅需要更好的预测,还需要更好地感知预测的可靠性。为保证可复现性,我们的全部数据与代码已在 https://github.com/scaleapi/scipredict 提供。

SciPredict:LLM能否预测自然科学的实验结果?:论文配图
图 3:SciPredict 管理流程。基准建设涉及四个综合阶段:(左上)从预印本存储库收集数据,确保 2025 年 3 月后截止,以防止数据泄露; (中上)专家注释,领域专家将原始论文转换为 MCQ、数值和自由形式的预测任务; (左下)任务结构执行,确保每个样本都包含实验设置、测量和专家策划的背景知识等细粒度字段; (中下)质量控制/保证,将迭代专家评审与确定性和基于LLM的验证相结合。右侧显示了结果预测任务的示例。