论文

PolyWorkBench:跨语言长程工作流的LLM智能体基准

PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows

智能体系统Agent任务评测长程任务评测

摘要

尽管LLM智能体擅长单语长程规划与工具使用,企业工作流天然要求跨扩展轨迹处理多语言资源。多语言与长程执行的交互仍未被充分探索。我们引入PolyWorkBench:评估LLM智能体多语言长程职场工作流的基准——含五大核心领域67个任务:商务、知识工作、法律分析、本地化与制造。任务由作者从真实数据种子撰写并经第二作者独立审计。智能体必须整合异构多语言输入、执行迭代工具使用轨迹并产出结构化领域工件。为严格评估表现,我们采用任务专属结构评分量规Grade作为主排名指标,辅以Pytest做可执行状态核验、LLM即裁判做语义质量诊断。基准评估揭示:智能体表现跨语言差异显著、在更难的跨语言任务上急剧下降;分析显示多语言执行暴露长程智能体在规划、工具交互与决策上的系统性失败模式。

PolyWorkBench:跨语言长程工作流的LLM智能体基准:论文配图
图 1:代表性任务 (MFG-00) 的概述。单个任务包含所有四个基准轴:跨语言轨迹分解、长期工具使用、跨源融合和多方面的地面实况评分。