论文

ProjectionBench:渐进信息披露下LLM科学假设生成评估

ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure

模型评测基准与评测资源

摘要

科学发现本质上是一个创造性且充满不确定性的过程,需要超越已知知识回忆的推理。尽管已有许多基准通过多跳检索评估大语言模型(LLM)在深度研究任务上的表现,但它们对真正科学发现至关重要的创新推理能力在很大程度上未被检验。我们引入一个评估模型科学发现与推理性能的基准框架,从原始问题逐步推进到经典的零假设检验。在我们的框架中,模型最初只收到一篇近期论文的主题与研究问题,技术细节被逐步揭示。在信息披露的每个阶段,模型的任务是生成针对研究问题的假设,将其与原论文结论进行比较,并通过构成性原子命题的自动语义相似度加以评估。这种对与真值结论语义分歧的渐进评估,使我们既能评估模型的创新性(最小信息条件下),也能评估其有依据的推理能力(完整实验细节条件下),两者对将LLM用于科学发现都至关重要。我们的框架为系统评估LLM的科学推理与发现能力奠定了基础,这对推进下一代AI科学家/共同科学家系统的发展至关重要。具体而言,我们在涵盖生物活性材料、机械材料与纳米材料的45篇论文上评估了GPT-5、GPT-5.4、Gemini 2.5 pro与Gemini 3.1 pro preview。我们发现GPT-5.4与Gemini 3.1 pro如预期优于各自上一代模型,其中GPT-5.4尤其突出,即使在最小上下文下也与真值结论保持0.7的F1分数对齐。

ProjectionBench:渐进信息披露下LLM科学假设生成评估:论文配图
图 1:真实结果和预测结果可以分为其组成部分,以便进行更精细的比较。一般来说,不完美的预测可能会错过真实情况的某些方面,或者包含超出真实情况的无关主张。