论文

通过跟踪条件 VLA 规划进行长视野操作

Long-Horizon Manipulation via Trace-Conditioned VLA Planning

智能体系统Agent 规划

摘要

对于视觉-语言-动作(VLA)策略来说,长期操纵仍然具有挑战性:实际任务是多步骤的、依赖于进度的,并且很容易复合执行错误。我们推出了 LoHo-Manip,这是一个模块化框架,可通过专用的任务管理 VLM 将短期 VLA 执行扩展到长期指令执行。管理器与执行器分离,并以后退方式调用:给定当前观察,它预测一个进度感知的剩余计划,该计划结合了(i)具有显式完成+剩余分割的子任务序列作为轻量级语言记忆,以及(ii)视觉跟踪 - 一个紧凑的 2D 关键点轨迹提示,指定下一步要去哪里以及要接近什么。执行器 VLA 适合以渲染的轨迹为条件,从而通过跟踪轨迹将长期决策转变为重复的本地控制。至关重要的是,预测每个步骤的剩余计划会产生隐式闭环:失败的步骤会保留在后续输出中,并相应地更新跟踪,从而实现自动延续和重新计划,而无需手工制作的恢复逻辑或脆弱的视觉历史缓冲区。在模拟和真实 Franka 机器人上进行的广泛实验涵盖了具体规划、长期推理、轨迹预测和端到端操作,证明了在长期成功、鲁棒性和分布外泛化方面的巨大进步。项目页面:https://www.liuisabella.com/LoHoManip