论文
PIVOT:通过轨迹细化弥合LLM智能体的规划与执行鸿沟
PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement
摘要
基于大语言模型(LLM)的智能体经常生成看似连贯却在执行时失败的规划,原因包括动作不可行、违反约束以及长时程上的误差累积。PIVOT(Plan-Inspect-eVOlve Trajectories)通过一个自监督框架来解决这种规划-执行错位,该框架将轨迹视为可通过环境交互迭代优化的对象。框架包含四个阶段:PLAN生成候选轨迹;INSPECT执行它们并计算结构化损失,其中的文本梯度编码规划与执行之间的差异;EVOLVE应用这些信号生成改进的轨迹;VERIFY针对任务约束执行最终的全局检查。单调接受过程确保解的质量不下降。在DeepPlanning与GAIA上的实证评估展现了最先进的性能:在引入人在回路(HITL)反馈时,PIVOT确立了很强的性能上界,约束满足最高获得94%的相对改进;其完全自主变体也保留了可观的增益,表明核心轨迹细化机制在无外部监督时仍然有效。同时,PIVOT保持计算高效,所需token最多比竞争的细化方法少3到5倍。这些发现确立了一个结论:基于反馈(自监督或人工监督)的轨迹优化是缓解自主智能体系统中规划-执行鸿沟的一种有原则的方法。
