论文

PIVOT:通过轨迹细化弥合LLM智能体的规划与执行鸿沟

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

智能体系统Agent 规划

摘要

基于大语言模型(LLM)的智能体经常生成看似连贯却在执行时失败的规划,原因包括动作不可行、违反约束以及长时程上的误差累积。PIVOT(Plan-Inspect-eVOlve Trajectories)通过一个自监督框架来解决这种规划-执行错位,该框架将轨迹视为可通过环境交互迭代优化的对象。框架包含四个阶段:PLAN生成候选轨迹;INSPECT执行它们并计算结构化损失,其中的文本梯度编码规划与执行之间的差异;EVOLVE应用这些信号生成改进的轨迹;VERIFY针对任务约束执行最终的全局检查。单调接受过程确保解的质量不下降。在DeepPlanning与GAIA上的实证评估展现了最先进的性能:在引入人在回路(HITL)反馈时,PIVOT确立了很强的性能上界,约束满足最高获得94%的相对改进;其完全自主变体也保留了可观的增益,表明核心轨迹细化机制在无外部监督时仍然有效。同时,PIVOT保持计算高效,所需token最多比竞争的细化方法少3到5倍。这些发现确立了一个结论:基于反馈(自监督或人工监督)的轨迹优化是缓解自主智能体系统中规划-执行鸿沟的一种有原则的方法。

PIVOT:通过轨迹细化弥合LLM智能体的规划与执行鸿沟:论文配图
图 2:PIVOT 概述,这是一个轨迹级优化框架,用于协调 LLM 代理中的规划和执行。给定任务 tt,Plan 模块生成候选轨迹 τ\tau,这些轨迹在环境 ℳ\mathcal{M} 中执行以生成轨迹 τ^\hat{\tau}。 Inspect 模块执行向后差异分析,计算损失 ℒ^\widehat{\mathcal{L}} 和文本梯度 gg,用于定位最早的故障点 i⋆i^{\star} 并将错误归因于轨迹步骤。在此信号的引导下,Evolve 模块通过保留已验证的前缀并重写不支持的后缀来更新轨迹,从而生成改进的候选 τ′\tau^{\prime}。这种迭代的“计划-检查-演化”循环在轨迹空间中执行类似梯度的优化。最后,Verify 强制满足全局约束,产生最终轨迹 τ⋆\tau^{\star},使计划与执行保持一致,同时尊重任务要求。