论文

WorldBench:以文化为基础的多语言智能体基准

WorldBench: Culturally Grounded Benchmark for Multilingual Agents

智能体系统Agent任务评测长程任务评测

摘要

尽管越来越多地使用 LLM 支持的代理来解决复杂环境中的多步骤任务,但现有的基准测试很少测试状态保存、跨语言的性能以及在现实、基础场景中的应用。为了解决这些问题,我们推出了 WorldBench:一个全面的、多语言的真实、基于角色的日常工作流程基准,代理可以通过结构化操作在沙箱中进行操作。 WorldBench 包含 7 种语言和 8 种文化的 1,600 项任务,并通过具有语言和文化特定专业知识的人工注释者的反馈进行过滤和完善。为了进行评估,我们扩展了之前工作中的指标,并引入了约束任务成功(CTS),它结合了自然语言指令和测试平台,通过确定性和LLM作为法官评估来对任务完成情况、最小修改和其他补充指标进行评分。我们的实验表明,前沿模型的 CTS 仅为 49.2%,所有模型的正确性和环境保护之间都存在很大差距。因此,我们表明当前的代理在多语言、代理场景中仍然很脆弱,特别是对于长期任务和状态保存约束下

WorldBench:以文化为基础的多语言智能体基准:论文配图
图1:世界环境建筑和验证管道。通过自动生成,然后利用语言和文化专用说明器过滤和精炼,扩大人文写作者、情景和种子。