论文

PlanBench-XL:大规模工具生态中LLM工具使用智能体的长程规划评估

PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

智能体系统Agent任务评测长程任务评测

摘要

LLM 代理越来越多地在大型工具生态系统中运行,其中现实世界的任务需要发现相关工具、推断隐含的子目标并适应长期的动态环境。然而,现有的基准很少在检索有限的工具可见性下评估规划。为了解决这一差距,我们引入了 PlanBench-XL,这是一个包含 1,665 种工具的 327 项零售任务的交互式基准测试,用于测试代理是否可以迭代地检索可用工具,调用它们来发现后续调用实现最终目标的中间证据。 PlanBench-XL 还具有可选的阻塞机制,通过丢失、失败或分散工具功能来模拟现实世界的不可预测性,迫使代理检测中断的路径并在运行时进行调整。对十个领先的大语言模型进行的实验表明,大规模工具规划仍然具有挑战性:虽然 GPT-5.4 在无阻塞设置中实现了 51.90% 的准确率,但在最严重的阻塞条件下,它的准确率下降到 11.36%。进一步的分析表明,当故障缺乏明确的错误信号或恢复需要更长的替代工具使用路径时,代理尤其容易受到攻击。这些结果将 PlanBench-XL 确立为诊断代理规划失败的测试平台,并强调在具有大型、不完善工具环境的长期任务中需要稳健的自适应规划。

PlanBench-XL:大规模工具生态中LLM工具使用智能体的长程规划评估:论文配图
图 1:PlanBench-XL 概述。数据构建将类型化的零售数据类型转变为可执行工具和后端记录,然后派生出可解决的查询和真实答案。运行时协议在代理通过双向探索检索和调用工具时对其进行评估,而检索时阻止程序则强制重新规划。