论文
多语言、多智能体规划失败的可行诊断
An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
摘要
多语言多代理系统表现出比英语严重的退化,但先前的工作很少确定当用户请求转换为可执行计划时关键任务信息是如何丢失的。我们研究多智能体系统中的规划器作为请求到行动的接口,并从失败的现实世界任务执行中得出规划基础失败的可操作分类法。基于 LLM 的分析表明,随着语言资源可用性的下降,这些失败在不成功执行中所占的比例越来越大,其中对低资源语言的影响最为强烈。为了测试分类法是否支持缓解措施,我们引入了 TART(分类法引导的可操作表示),它使分类法的关键方面向规划者和下游子代理明确。跨多种语言、三个 LLM 主干、两个数据集和两个代理配置,TART 持续提高性能。在多语言 GAIA 上,它将最先进系统的准确率提高了 5.6 个百分点,涵盖从低资源环境到高资源环境的 11 种语言。