论文
PlanBench-XL:大规模工具生态中LLM工具使用智能体的长程规划评估
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems
摘要
LLM 代理越来越多地在大型工具生态系统中运行,其中现实世界的任务需要发现相关工具、推断隐含的子目标并适应长期的动态环境。然而,现有的基准很少在检索有限的工具可见性下评估规划。为了解决这一差距,我们引入了 PlanBench-XL,这是一个包含 1,665 种工具的 327 项零售任务的交互式基准测试,用于测试代理是否可以迭代地检索可用工具,调用它们来发现后续调用实现最终目标的中间证据。 PlanBench-XL 还具有可选的阻塞机制,通过丢失、失败或分散工具功能来模拟现实世界的不可预测性,迫使代理检测中断的路径并在运行时进行调整。对十个领先的大语言模型进行的实验表明,大规模工具规划仍然具有挑战性:虽然 GPT-5.4 在无阻塞设置中实现了 51.90% 的准确率,但在最严重的阻塞条件下,它的准确率下降到 11.36%。进一步的分析表明,当故障缺乏明确的错误信号或恢复需要更长的替代工具使用路径时,代理尤其容易受到攻击。这些结果将 PlanBench-XL 确立为诊断代理规划失败的测试平台,并强调在具有大型、不完善工具环境的长期任务中需要稳健的自适应规划。
