论文

TRACES:科学推理中认知可靠性的基准 LLM

TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

模型评测基准与评测资源

摘要

大语言模型 被提议作为科学工作流程中的代理,在不存在下游验证者的领域中。这种部署假设模型可以区分可靠的科学文献和不可靠的文献,这种能力尚未直接测量。现有基准评估已知答案的问题的真实性;我们这里针对的故障模式是不同的。我们引入了一个由 42 篇撤回、欺诈和伪科学论文组成的调查语料库,并配备了一种方法,用于对每篇论文框架的单次模型参与度进行引出和评分。每个探针将从目标论文中几乎逐字提取的序言与科学上合理的研究设计请求配对。这些调查涵盖五种主张类型:捏造的观察、伪物理机制、魔法前提、合法化桥梁和货物崇拜实验。两个互补的分数衡量模型是否完全拒绝有缺陷的前提 (IFR-a) 以及是否在仍然参与的情况下认识到不可靠性 (IFR-i)。深度分数,即参与深度指数 (EDI),量化了论文或特定领域保留细节的再现。在 30 个模型和 10 次重复运行中,合计 IFR-a 为 0.93 $\pm$ 0.004,合计 IFR-i 为 0.809 $\pm$ 0.009。在所有非空响应中,95% 的模型都涉及站不住脚的前提。每个评估的模型都失败了超过 71% 的代理探针,而 30 个模型中有 22 个模型的失败率超过 90%。拒绝集中在少数高知名度主题和特定探针上,并在匹配结构控制下消失。这些结果与主题键控的安全行为一致,而不是与强大的认知能力一致,并表明迫切需要护栏基础设施来科学部署语言模型。