论文

长期任务的一致计划-行动 Agentic

Consistent Plan-Act for Long-Horizon Agentic Tasks

智能体系统Agent 协作

摘要

长期 Agentic 任务需要在与动态环境的连续交互中进行强大的推理和高效的执行。一种常见的方法是通过单独的规划者和参与者角色将高层规划与低层执行分离。为了调查这些任务中的协调失败,我们提示两个Agent进行结构化状态断言,并以编程方式比较他们的报告以检测明显的矛盾。我们的分析揭示了对相同任务相关状态事实的系统性分歧,我们将这种现象称为计划者-行动者状态不匹配。我们进一步发现,为Agent提供与任务相关的状态信息可以减少不匹配并提高协调和任务性能。基于对状态不匹配的系统分析,我们提出了一致的计划-行动(ConPAct),它将检测到的矛盾反馈给两个Agent,以形成一致的状态解释,并在策划的一致交互上对其进行微调,以实现更好的协调。 ConPAct 提高了各种环境和模型配置的性能,例如,使用 GPT-5.6-sol/terra 分别作为规划器和参与者,将 MiniGrid 成功率从 38.6% 提高到 54.4%,这表明状态一致性可以指导推理时间校正和协调训练。