论文

SciR:LLM科学推理的受控基准

SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

模型评测基准与评测资源

摘要

科学推理中反复出现三种典型的推理形式:演绎、归纳和因果溯因。在科学环境中可靠地评估这些方面的大语言模型目前还遥不可及:基于人类注释建立的科学基准成本高昂且缺乏机械的基本事实,而综合逻辑推理基准与真正的科学文档并不相似。我们推出了 SciR,这是一个将多范式推理与可控科学渲染相结合的基准,以三个典型的科学问题为基础。任务是从形式对象(演绎树、归纳规则假设、因果图)生成的,以保证可验证的答案,然后通过按轨道领域调整的流派呈现为多文档科学论述。这种结构让我们能够独立地改变两个难度轴:提取推理所需的关键信息有多困难,以及原则性推理本身有多困难。我们测试了六种模型。两个轴都会伤害每个模型,并且它们的影响会复合。渲染甚至会损害神经符号管道,它将推理交给经过验证的求解器。这两个轴产生每个模型的提取与推理概况:例如,像 deepseek-r1 这样的推理模型在推理轴上大多超过非推理指令模型。据我们所知,SciR 是第一个对提取和推理难度进行参数控制的多范式科学推理基准。