论文

预期-VLA:通过基于预期的子目标生成解决长期具体任务

Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation

智能体系统Agent 规划

摘要

视觉-语言-动作(VLA)模型已成为体现智能的强大范例,使机器人能够基于自然语言指令和当前视觉输入执行任务。然而,由于复合错误,现有的 VLA 模型难以处理长期任务。现有方法将任务分解为固定粒度的子任务,无法适应执行状态的复杂性变化,从而限制了它们在长范围任务中的鲁棒性。为了克服这个问题,我们引入了预期模型,它自适应地、递归地生成未来的子目标。该模型随着任务的展开不断适应,根据不断变化的动态调整未来的子目标,促进更可靠的规划路径。在此概念的基础上,我们提出了 Anticipation-VLA,这是一种分层 VLA 模型,利用预期模型生成指导 VLA 策略执行的可操作子目标。我们通过微调用于高级子目标生成的统一多模式模型(UMM)和用于低级操作执行的目标条件 VLA 策略来实现 Anticipation-VLA。模拟和现实世界机器人任务中的实验证明了 Anticipation-VLA 的有效性,强调了自适应和递归子目标生成对于稳健策略执行的重要性。