论文

RoboAgent:链接具体任务规划的基本功能

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

智能体系统Agent 规划

摘要

本文重点关注具体的任务规划,其中代理从环境中获取视觉观察并执行原子操作来完成给定的任务。尽管最近的视觉语言模型(VLM)在多模态理解和推理方面取得了令人印象深刻的成果,但当应用于涉及多轮交互、长视野推理和扩展上下文分析的具体规划时,其性能仍然有限。为了弥补这一差距,我们提出了 RoboAgent,这是一种功能驱动的规划管道,其中模型主动调用不同的子功能。每个能力维护自己的上下文,并根据调度程序给出的查询产生中间推理结果或与环境交互。该框架将复杂的规划分解为一系列基本的视觉语言问题,VLM 可以更好地解决这些问题,从而实现更加透明和可控的推理过程。调度程序和所有功能均通过单个 VLM 实现,无需依赖外部工具。为了训练这个 VLM,我们采用了多阶段范式,其中包括:(1)使用专家计划进行行为克隆,(2)使用模型收集的轨迹进行 DAgger 训练,以及(3)由专家策略指导的强化学习。在这些阶段中,我们利用环境模拟器的内部信息为每种能力构建高质量的监督,并进一步引入增强和合成数据以增强模型在更多样化场景中的性能。对广泛使用的具体任务规划基准进行的大量实验验证了所提出方法的有效性。我们的代码将在 https://github.com/woyut/RoboAgent_CVPR26 上提供。