论文

AppWorld-UL:面向多样化智能体—用户交互的工具使用基准

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

智能体系统Agent任务评测

摘要

处理订菜等日常数字任务的工具使用智能体不仅要操作应用,还要与用户交互——例如提出澄清问题、提示确认、以及在指令不可行时告知用户。但当前评估智能体—用户交互的基准未捕捉这类交互的多样性;且它们运行在API少、常不改变状态的小环境中。为弥合该差距,我们提出AppWorld-UL,一个需要多样化智能体—用户交互、含516个挑战性任务的人机在环(user-in-the-loop)基准。在带Amazon、Spotify等9个热门仿真应用的AppWorld框架之上,我们系统修改原任务以引入含糊与约束,迫使各类智能体—用户交互;用户行为由LLM仿真——被提示以精心设计的知识边界回应,提供比既往工作所用无约束或过度僵硬的替代方案更可靠的仿真。评估显示:最先进LLM Claude Opus 4.7在AppWorld-UL上仅48.6%成功,在更难的组合子集上仅35.7%;在更严格的场景级指标上,组合任务表现跌至21.3%。分析揭示正确的用户交互对成功至关重要。这证明该基准的难度及其推进人机在环工具使用智能体研究的潜力。

AppWorld-UL:面向多样化智能体—用户交互的工具使用基准:论文配图
图 1:AppWorld-UL 中需要代理与用户交互的三种现象。规格不足:明确当有多条路径可用时应采取哪条路径。不可行性:当出现不可行性时进行沟通。需要批准:在执行高成本的行动之前寻求明确的确认。代理与环境的交互是隐藏的。