论文
TruthInsightBench:一种基于证据的开放性科学发现智能体自动评估基准
TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
摘要
自主编码智能体越来越多地被认为是进行分析和撰写研究报告的人工智能科学家系统,但执行规定的分析并不等同于做出发现。现有的基准是为了再现而配置的:任务、数据和标准是围绕隐藏目标研究构建的,并且对其结果的恢复会得到奖励。我们推出了 TruthInsightBench,这是一个为发现而配置的基准。它的 40 项盲任务来自 10 个科学领域的 40 项同行评审研究,仅公开中立的科学目标和冻结的数据;源结论、预期值和分析路径都被保留,让智能体来确定数据支持什么主张。基于大语言模型的固定法官沿着六个维度对智能体自己的主张的证据成熟度进行评分,可操作为 29 个基于工件的项目,具有自动、确定性聚合,并且没有每个实例的人工评分,因此随着智能体的发展,可以自动重复评估。在一个冻结的基础模型上,四个编码智能体形成一个狭窄的平台(100 中的 58.4-60.3),没有统计上可靠的成对分离:它们能够胜任地执行和记录分析,具有相对较强的证据可审计性和新颖性,但很大程度上缺乏建立可信声明的区分行为(控制、稳健性、可证伪性和跨数据集泛化)。瓶颈在于科学判断而不是编码,真正的发现仍然遥不可及。 TruthInsightBench 使这一差距成为可衡量的目标;数据和评分代码位于此 https URL 。
