论文

GraphThink:面向长时程具身任务规划的图增强大语言模型思考

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

智能体系统模型训练上下文与知识强化学习记忆Agent 规划RLVRAgent记忆

摘要

使用基于大语言模型规划器的具身智能体常常受困于物理幻觉、对长时程任务泛化不佳以及缺乏环境感知。我们提出GraphThink,一个新颖框架,集成任务图以提供结构化知识支持稳健规划,并集成场景图以维护环境记忆、支持事件驱动的重规划。具体而言,任务图通过上下文提示词与迭代精炼引导大语言模型思考,有效缓解规划幻觉。此外,在GRPO框架内,任务图提供精细的奖励设计来训练大语言模型规划器,增强长时程规划能力并改善泛化。最后,由场景图驱动的事件驱动重规划模块实现闭环的环境感知与纠错。GraphThink在ALFRED基准上取得最先进性能。特别是,我们的高层规划器在验证集与留出的长时程任务上均超越领先的基于API的大语言模型,凸显其稳健的零样本与少样本能力。额外评估进一步证明了对新任务与新环境的强分布外泛化。

GraphThink:面向长时程具身任务规划的图增强大语言模型思考:论文配图
图1:GraphThink由三个核心模块组成:(a) 带任务图的高层规划器生成初始计划;(b) 具备记忆意识的低层策略为每个子任务执行导航与交互动作;(c) 带场景图的动态重规划在执行过程中调整计划。此处的示例显示,在子任务“put(knife, sidetable)”完成后触发重规划,修订后的子任务变为“pickup(knife)”和“put(knife, dining table)”。