论文
ST-Bench:面向科研任务的多 Agent 时空基准
ST-Bench: A Spatial-Temporal Benchmark for Multi-Agent System Generation on Scientific Research Tasks
摘要
基于 LLM 的多智能体系统 (MAS) 的快速进展表明,它们在编码、数学和 QA 任务上大大优于单个智能体,其中可执行测试提供二进制成功信号。这种优势是否能转化为真正的科学数据分析仍有待检验。我们推出 ST-Bench,这是一个旨在回答两个问题的基准测试:在复杂的科学数据分析任务上,MAS 是否优于单个智能体,如果是的话,优于多少以及需要多少额外成本。 ST-Bench 包含 100 个数据科学任务,这些任务改编自已发表的水文学、农业和湿地甲烷研究的地球科学研究,并扩展到基于其他已发表的研究并由领域专家验证的 2,067 个查询。使用 ST-Bench,我们根据同一 GPT-5 骨干模型 上的单智能体基线,评估了两个训练协议下的五种最新 MAS 生成方法。十种 MAS 配置中的九种超过了最便宜的单智能体基线,其中最强的达到了其综合得分的近三倍。这种增益主要归因于覆盖范围:训练有素的工作流程在大部分查询上生成真实的数字指标,而这些指标的质量(以生成真实输出为条件)与单智能体基线的质量相当。最强大的配置需要大约四倍于单智能体推理时间,而更经济的工作流程可以以不到两倍的成本获得大部分优势。 MAS 专业化为科学数据分析带来了可衡量的好处,但这种好处是有条件的而不是普遍的。