论文

面向可指令智能体的规划与控制解耦

Decoupling Planning and Control for Instructable Agents

摘要

近期工作表明,经过指令微调的预训练视觉语言模型(VLM)善于将指令和观察映射为高层计划,但难以在陌生环境中把这些计划实现为可靠的低延迟动作序列。与此同时,世界模型控制器擅长快速的观察到动作控制,但缺乏开放式任务指导。在本工作中,我们将两者优势结合为单一系统Instruct-to-Act:训练一个世界模型控制器,在以VLM规划器生成的稀疏、延迟较高、高层的文本指令为条件时高频自主行动。为训练控制器具备语言可指令性,我们用合成指令重新标注控制器策略回放的片段,并将行为克隆目标与既有的奖励最大化及世界建模目标联合优化。我们在七个具身环境中评估所提方法,其中包括三个多智能体环境,在这些环境中VLM规划器通过语言进行协调,而训练好的控制器充当其执行器。在观察与动作空间匹配的条件下,我们的解耦方法持续优于仅控制器和直接VLM动作生成两种变体,保留了快速控制,并且无需微调即可替换不同的预训练VLM规划器,同时在七个任务中的六个上与强视觉-语言-动作和多智能体RL基线相当。

面向可指令智能体的规划与控制解耦:论文配图
图1:使用 VLM 规划器与经训练控制器的推理示意图。