论文

Gaia2:在动态与异步环境中对LLM智能体进行基准评测

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

智能体系统模型训练强化学习Agent任务评测RLVR

摘要

我们提出Gaia2,一个在真实异步环境中评测大型语言模型智能体的基准。与以往静态或同步的评测不同,Gaia2引入环境独立于智能体动作演化的场景,要求智能体在时间约束下运行、适应嘈杂且动态的事件、消解歧义并与其他智能体协作。每个场景都配有写动作验证器,支持细粒度的动作级评估,并使Gaia2可直接用于可验证奖励的强化学习。我们对最先进的专有与开源模型的评估显示,没有任何模型在所有能力上占优:GPT-5(high)取得最高的42% pass@1总分但在时间敏感任务上失败,Claude-4 Sonnet以精度和速度换取成本,Kimi-K2以21% pass@1位居开源模型之首。这些结果凸显了推理、效率与稳健性之间的根本权衡,并暴露出弥合“sim2real”差距的挑战。Gaia2依托开源的Agents Research Environments平台构建于消费环境之上,并被设计为易于扩展。通过随基础性的ARE框架一起发布Gaia2,我们旨在为社区提供灵活的基础设施,以开发、评测和训练下一代实用的智能体系统。

Gaia2:在动态与异步环境中对LLM智能体进行基准评测
图12:ARE 中多轮场景的时序图。智能体在轮次之间暂停,即在调用 send_message_to_user 与接收 send_message_to_agent 之间,并根据来自环境的一条异步通知(一封新邮件)调整其策略。