论文
IsoSci:同构跨领域科学问题的基准,用于评估 LLM 中的推理与知识检索
IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs
摘要
我们引入 ISOSCI,同构跨领域科学问题对的基准,它将 LLM 评估中的推理能力与领域知识检索分开。每对共享相同的逻辑结构,但需要不同的特定领域知识,从而实现推理模式增益的受控归因。在跨越四个模型系列的五个模型对中,我们发现 91.3% 的推理模式增益是知识相关的,而不是结构不变的(63/69 增益;Wilson 95% CI [82.3%, 96.0%]),直接挑战了思想链推理改善短期程序科学问题解决的假设。高性能模型上的推理切换在所有领域中提供了不到 5 个百分点的准确度增益,而推理专用模型 (o3-mini) 在 GPQA Diamond 上的表现优于其标准模型(+19.2 个百分点),但在 ISOSCI 上的表现却较差(-24.7 个百分点),这表明基准选择决定了有关推理效用的结论。我们在 https://huggingface.co/datasets/isosci/isosci 上发布了 ISOSCI