论文
World Action Agent:通过 World Action Rehearsal 利用 VLM 进行机器人操作
World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal
摘要
通用视觉语言模型(VLM)为机器人操作带来了广泛的知识和空间推理,但现有系统要么间接使用它们来预测约束或编写程序,要么为它们提供场景视图而不是行动的世界。我们推出了 World Action Agent (WAA),这是一种多代理工具,VLM 通过它使用基本工具来驾驶机器人,在视觉动作工作空间内做出每一个决定。工作区具有三个属性。从场景几何体中自动选择的接触视图呈现当前交互周围的场景。行动排练将每个行动转变为可编辑的建议,代理可以单独或通过想象力代理在执行前根据计划反馈进行预览和修改。视图内校正关闭了观察、排练和低级执行之间的循环,让代理消除其观察到的视图中的残余偏移。通过同一工作空间,WAA 以两种方式获取具体的程序知识:它在基于证据的审查下从专家视频和人工教学中发展出多模式技能,并通过技能代理进行咨询,其交互轨迹训练较小的 VLM 来试验相同的工具。在 LIBERO-Pro 上,具有仅从 LIBERO-90 发展而来的技能的 WAA 达到了最先进的 75.6% 平均成功率,优于端到端 VLA、代码即策略代理和具有相同主干的视觉Harness基线;相同的技能在 robosuite 上仍然有效,无需进一步学习。对Harness轨迹进行微调 Qwen3.5-9B 将其域外成功率从 1.7% 提高到 43.3%。