论文
DeepPlanning:用可验证约束对长程Agentic规划进行基准测试
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
摘要
尽管智能体评估已转向长程任务,大多数基准仍强调局部、步级推理,而非需要真正规划能力的全局约束优化(如时间和财务预算)。同时,现有LLM规划基准对现实场景中典型的主动信息获取和细粒度局部约束表现不足。为此,我们提出DeepPlanning,一个面向实用长程智能体规划的高难度基准。其特色是多日旅行规划和多商品购物任务,要求主动信息获取、局部约束推理和全局约束优化。在DeepPlanning上的评估显示,即使前沿Agentic LLM也难以应对这些问题,凸显了可靠的显式推理模式和并行工具使用对实现更好效果-效率权衡的重要性。错误分析进一步指出了改进Agentic LLM长程规划能力的有前景方向。我们开源代码和数据以支持未来研究。
