论文
BabelArena:LLM 代理的大规模多语言基准
BabelArena: A Large-Scale Multilingual Benchmark for LLM Agents
摘要
大型语言模型 (LLM) 代理越来越多地通过工具使用以及与用户和环境的交互来执行多步骤工作流。然而,当前的代理评估主要以英语为中心,限制了我们对多语言环境中代理能力的理解。我们引入了 BabelFlow,一种基准测试通用代理工作流程,通过分析运行时依赖关系、协调结构保留翻译以及将多层验证与人工审查相结合以保留任务和评估语义,使现有代理基准测试适应新语言。使用 BabelFlow,我们构建了 BabelArena,这是一个任务对齐的基准,包含 16,146 个实例,这些实例源自 4 个基准系列、13 个领域和 23 种语言的 702 个规范任务。对五个前沿模型的实验表明,没有任何一个模型能够在基准系列中占据主导地位,并且跨语言差异远远超出了任务成功的范围。资源较低的语言表现出独特的故障模式,工具使用和控制流错误的比例更大,而不仅仅是答案质量错误,这表明这些语言的资源级别之间的可靠任务执行存在差距。在相同的任务中,低资源语言的代理也比英语消耗更多的标记(大约是输入的两倍),而交互长度却没有按比例增加,并且在需要结构化输出的任务上,语言一致性进一步下降,其中开关绝大多数针对英语。我们相信 BabelArena 为推进可靠、高效的多语言代理研究奠定了基础。