论文
代理规划基准:LLM 代理中规划功能的诊断框架
Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents
摘要
规划是 LLM 智能体的核心:在行动之前,智能体必须分解目标、选择工具、对约束进行推理,并决定任务何时不可行。然而,现有的代理评估通常只报告端到端的成功,因此很难确定失败是源于计划还是执行。我们引入了代理规划基准 (APB),这是一个特定于规划的诊断基准,包含 22 个领域和 5 个设置的 4,209 个多模式案例,涵盖整体规划、反馈条件逐步规划以及无关工具、破损工具和无法解决的任务下的鲁棒性。在 12 个 MLLM 中,APB 揭示了长期规划、工具噪声鲁棒性、校准拒绝和推理时间细化方面的系统性弱点。我们进一步在 200 个 ToolSandbox 任务和 200 个 $τ^2$-bench 任务上验证 APB,其中 APB 引导的细化持续改进了三个代表性模型的计划正确性、计划等级和下游执行指标。因此,APB 可以作为执行基准的上游诊断补充。 APB 基准测试和代码可在 \href{https://github.com/Mikivishy/AgentPlanningBenchmark}{此 URL} 中找到。