论文

SciIF:面向严谨科学智能的科学指令遵循基准评测

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

模型评测基准与评测资源

摘要

随着大语言模型(LLM)从通用知识检索转向复杂科学发现,其评测标准也必须纳入科学探究的严谨规范。现有基准存在一个关键盲区:通用指令遵循指标只关注表层的格式,而领域专用科学基准只评估最终答案的正确性,常常使以错误理由得到正确结果的模型获得奖励。为填补这一空白,我们提出科学指令遵循(scientific instruction following):在严格遵守确立科学有效性的约束的前提下解决问题的能力。具体而言,我们提出 SciIF,一个多学科基准,通过将大学级问题与固定的约束目录配对来评估这一能力,约束覆盖三大支柱:科学条件(如边界检查与假设)、语义稳定性(如单位与符号约定)以及特定过程(如要求的数值方法)。其独特之处在于强调可审计性,要求模型提供满足约束的显式证据而非隐式合规。通过同时衡量解的正确性与多约束遵循情况,SciIF 能够对组合推理失败进行细粒度诊断,确保 LLM 能够在科学的严格逻辑框架内充当可靠的智能体。

SciIF:面向严谨科学智能的科学指令遵循基准评测 配图
图 2:SciIF 概览。我们从多个来源策展科学问答(QA)数据,并应用四阶段人机协同流程,产出表述良好的问题,并配以明确的科学约束与可审计的证据清单。在评估时,提示构建器生成答案生成提示与逐约束评判提示,两个独立的模型评判者在严格(Strict)或宽松(Loose)策略下同时审计答案正确性与约束符合性。示例突显了一个核心失败模式:答案在数值上可以与参考答案一致,但在缺少单位等必要证据以及单行单位核查时不满足符合性。