论文
全语言GAIA2:评估前沿人工智能代理的多语言差距
OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents
摘要
Agentic 基准测试旨在衡量 AI 代理在现实的多工具环境中计划、搜索、执行和恢复的情况,但它们几乎都是英文的。随着人工智能代理在全球范围内部署到不同语言的用户群,以英语衡量的代理能力是否可以转移到其他语言仍然是一个悬而未决的问题。我们推出了 OmnilingualGAIA2,这是 GAIA2 代理基准的机器翻译扩展(经过部分人类专家验证),涵盖跨越五种书写系统的十种目标语言,并配有本地化和人工校准的多语言验证器。通过评估七个前沿和开放权重代理,我们发现普遍的跨语言差距为 8.8-18.4 pass@3 点,该差距在大小上是代理不对称的,集中于工具编排而不是定量推理,并且不随模型规模而缩小。分层错误归因将差距分解为主要由模型驱动(55%),而有限的翻译污染底限仅为场景语言对的 6.4%。人类专家语言分析进一步确定形态线索丢失和歧义扩大是非拉丁文字语言的主要失败机制。我们的结果表明,多语言代理评估必须成为全球部署代理报告协议的标准部分。