论文
VIA:用于机器人控制的视觉界面代理
VIA: Visual Interface Agent for Robot Control
摘要
机器人操纵是一项复杂的任务,需要视觉理解、物理推理、规划和闭环控制。通用基础模型(FM)在其中一些方面的能力已经显着增强,尤其是视觉和推理。为了利用这一点来实现通用机器人策略,当前的方法通常涉及通过机器人数据上的 微调 将现有 FM 转换为视觉语言动作 (VLA) 模型,以输出底层动作。然而,鉴于 微调 可用的数据和计算有限,VLA 通常比前沿 FM 小几个数量级,这反过来又限制了它们的一般能力。受到 FM 通过视觉界面操作软件的能力不断增强的启发,我们询问同样的能力是否足以控制机器人。我们提出了 VIA(机器人控制可视化界面代理),这是一个将机器人控制重塑为代理任务的框架:现成的 FM 驱动的代理通过基于浏览器的 3D 界面通过截屏、发出直观命令、观察结果和调整来驱动操纵器。该代理不会收到机器人特定的 微调,也无法访问特权状态信息:它感知视觉输入并通过一小组通用工具进行操作。 VIA 继承了智能体的一般推理、闭环错误恢复以及根据观察到的情况进行计划和重新计划的能力。它使用 Claude Code 和 Codex 零次解决了各种桌面操作任务。凭借最强的模型(《神鬼寓言 5》),它在三个 LIBERO-Goal 任务上取得了 96.7% 的成功率,在长视界彩虹组装任务上取得了 100% 的成功率。性能随着底层模型的规模和强度而提高。这些结果表明,前沿智能体已经拥有在正确的界面下直接转移到机器人控制的技能:你的编码或计算机使用智能体在某种意义上是秘密的机器人控制智能体。