论文

Goal2Skill:通过自适应规划和反思进行长期操纵

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

摘要

最近的视觉-语言-动作(VLA)系统在具体化操作方面表现出了强大的能力。然而,大多数现有的 VLA 策略依赖于有限的观察窗口和端到端的动作预测,这使得它们在具有部分可观察性、遮挡和多阶段依赖性的长期、依赖于记忆的任务中变得脆弱。此类任务不仅需要精确的视觉运动控制,还需要持久记忆、自适应任务分解以及从执行失败中显式恢复。为了解决这些限制,我们提出了一个用于长程具身操作的双系统框架。我们的框架明确地将高级语义推理与底层运动执行分开。高级规划器作为基于 VLM 的代理模块实现,维护结构化任务记忆并执行目标分解、结果验证和错误驱动纠正。底层执行器实例化为基于 VLA 的视觉运动控制器,通过基于扩散的动作生成来执行每个子任务,这些动作生成以保留几何形状的过滤观察为条件。这两个系统共同形成规划和执行之间的闭环,从而实现内存感知推理、自适应重新规划和强大的在线恢复。对代表性 RMBench 任务的实验表明,所提出的框架大大优于代表性基线,实现了 32.4% 的平均成功率,而最强基线的平均成功率为 9.8%。消融研究进一步证实了结构化记忆和闭环恢复对于长视野操作的重要性。