论文

跨尺度科学挑战的AI智能体基准测试

Benchmarking AI Agents for Addressing Scientific Challenges Across Scales

智能体系统Agent任务评测

摘要

人工智能代理越来越多地被开发来加速科学发现,但它们在实际研究环境中的实际能力仍然知之甚少。现有的人工智能代理基准很少能够捕获科学工作所需的复杂性、异质性和扩展推理,而科学任务的基准通常将研究减少到静态、直接问题,并对交互式评估提供有限的支持。在这里,我们介绍 SciAgentArena,这是一个系统基准,用于评估现实世界科学研究场景中的人工智能代理,这些场景来自多个领域的新兴需求。 SciAgentArena 包含大约 200 个任务,具有逐步验证和用于评估不同 AI 代理的交互式、与代理无关的环境。使用这个基准,我们发现当前的代理可以有效地为明确的数据分析工作流程做出贡献,特别是当任务结构和评估标准明确时。然而,它们在不同科学背景下的表现仍然参差不齐:智能体努力产生真正新颖的见解,维持自我导向的探索,并为开放式研究问题制定强有力的解决方案。我们进一步描述了代理的常见故障模式,并确定了提高其可靠性、自主性和科学推理的机会。 SciAgentArena 共同提供了一个实用的框架,用于衡量科学 AI 代理的进展,并指导设计能够应对复杂科学挑战的未来代理。完整的代码、任务和数据集可以通过以下链接访问:https://sciagentarena.github.io/。

跨尺度科学挑战的AI智能体基准测试:论文配图
图 1:SciAgentArena 概述。 (a) 当前人工智能代理基准的局限性。 (b) 当前科学基准的局限性。 (c) 从我们的基准中选择任务作为示例。 (d) 运行时间和评估框架,以及不同类别任务的比例。 (e) GPT 5.2 生成的 AIME 分数与特定领域最佳代理生成的 SciAgentArena 分数之间的比较。