论文

ViGAR:视觉目标条件动作推理WAM

Rethinking World-Action Model for Compositional and In-Context Robotic Manipulation

摘要

长程组合操作对真实机器人部署日益重要:单个任务包含多个协调的子任务。现有世界动作模型(WAM)联合预测短程视觉未来与动作,但通常缺乏显式的子任务级推理。我们提出视觉目标条件动作推理(ViGAR),把操作分解为视觉子目标规划器与子目标执行器的分层框架:给定当前观测与全局指令,规划器预测下一子任务的视觉子目标;执行器以预测子目标为条件联合生成未来视觉轨迹与动作。两组件共享预训练世界模型表示,使任务级规划与动作生成受益于共同物理知识。框架还自然支持上下文学习:以全局目标图像为上下文可在不更新参数的情况下诱导不同的子任务分解与行为。在RoboTwin Clean2Random基准上,ViGAR在Clean与Random设置分别达到82.00%与67.02%成功率,平均成功率超最强基线12.86个百分点;五个组合任务与两个上下文学习任务的真机实验进一步证实其有效性。