论文

TruthInsightBench:一种基于证据的开放性科学发现智能体自动评估基准

TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents

智能体系统Agent任务评测

摘要

自主编码智能体越来越多地被认为是进行分析和撰写研究报告的人工智能科学家系统,但执行规定的分析并不等同于做出发现。现有的基准是为了再现而配置的:任务、数据和标准是围绕隐藏目标研究构建的,并且对其结果的恢复会得到奖励。我们推出了 TruthInsightBench,这是一个为发现而配置的基准。它的 40 项盲任务来自 10 个科学领域的 40 项同行评审研究,仅公开中立的科学目标和冻结的数据;源结论、预期值和分析路径都被保留,让智能体来确定数据支持什么主张。基于大语言模型的固定法官沿着六个维度对智能体自己的主张的证据成熟度进行评分,可操作为 29 个基于工件的项目,具有自动、确定性聚合,并且没有每个实例的人工评分,因此随着智能体的发展,可以自动重复评估。在一个冻结的基础模型上,四个编码智能体形成一个狭窄的平台(100 中的 58.4-60.3),没有统计上可靠的成对分离:它们能够胜任地执行和记录分析,具有相对较强的证据可审计性和新颖性,但很大程度上缺乏建立可信声明的区分行为(控制、稳健性、可证伪性和跨数据集泛化)。瓶颈在于科学判断而不是编码,真正的发现仍然遥不可及。 TruthInsightBench 使这一差距成为可衡量的目标;数据和评分代码位于此 https URL 。

TruthInsightBench:一种基于证据的开放性科学发现智能体自动评估基准:论文配图
图 1:TruthInsightBench 的信息边界。任务 τ=(g,D,M,T0∣p*,F*,A*)\tau=(g,D,M,T_{0}\mid p^{*},F^{*},A^{*}) 仅公开智能体可见的输入(左):中立研究目标 gg、冻结科学数据 DD、元数据 MM、文献截止 T0T_{0} 和统一研究要求。右侧的评估端资产,即源研究身份 p*p^{*}、非详尽参考结果 F*F^{*}、验证资产 A*A^{*} 以及评分项和权重在执行过程中保持私有。运行时边界是单向的:只有冻结的运行输出 y=(π,o,r)y=(\pi,o,r) 在执行后交叉,以便在运行后针对私有资产进行评分,而源结论和评估资产永远不会流回任务工作区。我们不能保证基础模型在预训练期间从未遇到过相关论文,因此我们声称协议级盲目性,而不是绝对的污染自由。