论文
跨领域基准揭示协调式AI智能体何时能改进基于部分证据的科学推断
Cross-domain benchmarks reveal when coordinated AI agents improve scientific inference from partial evidence
摘要
科学证据往往跨越仪器、数据库和学科,因此没有任何单一来源记录完整的现象。这使得难以判断协调式AI智能体何时能比更简单的科学工作流产生额外价值。我们用一个横跨四项科学任务的跨领域基准来评估该问题:将分子结构映射为音乐表示、检测科学史上的范式转变、识别虫媒疾病的出现以及审核凌星系外行星候选体。每个案例都采用冻结的评估小组、预先定义的评分协议、明确的基线、消融或零对照,并声明了局限性。结果界定了三种运行状态。当不同学科各自只捕捉到现象的一部分时,跨通道组合优于单通道基线:气候-病媒出现任务的AUROC达到0.944,系外行星审核达到AUROC 0.955。然而,系外行星工作流与一个强组合摘要基线基本持平,表明分解并不总能提升顶层性能。当单一信号占主导时(如范式转变检测),协调主要改善解释性与可追溯性。对分子声音化而言,收益是表示层面的而非预测层面的。ScienceClaw x Infinite为该评估提供了可审计的产物与溯源层。因此,只有当相应的性能、溯源或表示主张有明确对照支持时,该基准才将价值归于协调。
