论文

AR-WAM:用于机器人操作的视觉条件代理就绪世界动作模型

AR-WAM: A Visual-Conditioned Agent-Ready World Action Model for Robotic Manipulation

智能体系统Agent 环境交互

摘要

随着人工智能代理的能力越来越强,代理驱动的机器人控制正在成为一种引人注目的范例。然而,流行的视觉语言动作(VLA)模型和世界动作模型(WAM)仍然依赖自然语言指令来指定操作任务,这是一个不适合代理驱动控制的界面:指称模糊,空间不精确,与代理固有的语言理解冗余,以及与执行的意图纠缠在一起。我们提出了 AR-WAM,一种视觉调节的、代理就绪的世界动作模型,它用两个互补条件取代语言:表示交互对象和位置的视觉基础提示(目标的边界框),以及指示要执行的原子技能的可学习操作词元。我们的紧凑型 0.5B 参数模型具有冻结的预训练视觉编码器且没有语言编码器,可以在解码动作的同时预测紧凑潜在状态内的场景演化,通过显式的、可监督的推理信号揭示策略的意图。与模型无关的兼容性层提供三个原语(检测、执行和查询),以便本地 VLM 或在线代理 API 可以直接驱动策略,并将长范围内存和闭环错误恢复委托给代理端。在 RoboTwin 2.0、RMBench 和真正的 Astribot S1 双臂平台上,AR-WAM 匹配标准操作的最强基线(平均成功率为 87.2%),并在依赖内存和真实机器人长视野任务上优于它们,成功率分别提高了 5.9% 和 36.7%,同时保持最低推理延迟(14.1 毫秒)。