论文
SciIF:面向严谨科学智能的科学指令遵循基准评测
SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence
摘要
随着大语言模型(LLM)从通用知识检索转向复杂科学发现,其评测标准也必须纳入科学探究的严谨规范。现有基准存在一个关键盲区:通用指令遵循指标只关注表层的格式,而领域专用科学基准只评估最终答案的正确性,常常使以错误理由得到正确结果的模型获得奖励。为填补这一空白,我们提出科学指令遵循(scientific instruction following):在严格遵守确立科学有效性的约束的前提下解决问题的能力。具体而言,我们提出 SciIF,一个多学科基准,通过将大学级问题与固定的约束目录配对来评估这一能力,约束覆盖三大支柱:科学条件(如边界检查与假设)、语义稳定性(如单位与符号约定)以及特定过程(如要求的数值方法)。其独特之处在于强调可审计性,要求模型提供满足约束的显式证据而非隐式合规。通过同时衡量解的正确性与多约束遵循情况,SciIF 能够对组合推理失败进行细粒度诊断,确保 LLM 能够在科学的严格逻辑框架内充当可靠的智能体。
