论文

跨领域基准揭示协调式AI智能体何时能改进基于部分证据的科学推断

Cross-domain benchmarks reveal when coordinated AI agents improve scientific inference from partial evidence

智能体系统Agent HarnessAgent任务评测

摘要

科学证据往往跨越仪器、数据库和学科,因此没有任何单一来源记录完整的现象。这使得难以判断协调式AI智能体何时能比更简单的科学工作流产生额外价值。我们用一个横跨四项科学任务的跨领域基准来评估该问题:将分子结构映射为音乐表示、检测科学史上的范式转变、识别虫媒疾病的出现以及审核凌星系外行星候选体。每个案例都采用冻结的评估小组、预先定义的评分协议、明确的基线、消融或零对照,并声明了局限性。结果界定了三种运行状态。当不同学科各自只捕捉到现象的一部分时,跨通道组合优于单通道基线:气候-病媒出现任务的AUROC达到0.944,系外行星审核达到AUROC 0.955。然而,系外行星工作流与一个强组合摘要基线基本持平,表明分解并不总能提升顶层性能。当单一信号占主导时(如范式转变检测),协调主要改善解释性与可追溯性。对分子声音化而言,收益是表示层面的而非预测层面的。ScienceClaw x Infinite为该评估提供了可审计的产物与溯源层。因此,只有当相应的性能、溯源或表示主张有明确对照支持时,该基准才将价值归于协调。

跨领域基准揭示协调式AI智能体何时能改进基于部分证据的科学推断:论文配图
图 10:以工件为中介的基准基础设施。四个应用程序(左)的域输入通过 ScienceClaw ×\times Infinite 工作流程进行路由,包括技能注册表、DAG、LLM Reasoner 和 Heartbeat Cycle。该引擎生成一个内容散列、模式版本化的工件存储,具有起源 DAG 和跨代理重用(中心)。然后,存储的工件支持分子结构恢复、回顾性范式转变辨别、气候矢量出现检测和凌日系外行星审查的验证和基准测试面板(右)。