论文
PolyWorkBench:跨语言长程工作流的LLM智能体基准
PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows
摘要
尽管LLM智能体擅长单语长程规划与工具使用,企业工作流天然要求跨扩展轨迹处理多语言资源。多语言与长程执行的交互仍未被充分探索。我们引入PolyWorkBench:评估LLM智能体多语言长程职场工作流的基准——含五大核心领域67个任务:商务、知识工作、法律分析、本地化与制造。任务由作者从真实数据种子撰写并经第二作者独立审计。智能体必须整合异构多语言输入、执行迭代工具使用轨迹并产出结构化领域工件。为严格评估表现,我们采用任务专属结构评分量规Grade作为主排名指标,辅以Pytest做可执行状态核验、LLM即裁判做语义质量诊断。基准评估揭示:智能体表现跨语言差异显著、在更难的跨语言任务上急剧下降;分析显示多语言执行暴露长程智能体在规划、工具交互与决策上的系统性失败模式。
