论文

MotorMind:零样本机器人操作的通用视觉语言模型的脚手架

MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation

智能体系统Agent Harness

摘要

视觉语言动作(VLA)模型具有先进的机器人操作,但它们在新任务和环境中的零样本泛化仍然有限,并且它们对专门训练的依赖使它们无法直接从快速发展的通用视觉语言模型(VLM)中受益。与此同时,最近的 Agentic 机器人系统利用 VLM 进行高级推理或编码Agent以进行机器人控制,但通常依赖于广泛的外部模型和工具,从而引入了额外的复杂性和成本。这促使我们问:通用 VLM 本身是否可以像人类远程操作员一样操作机器人,直接根据观察进行推理、发出动作并不断适应执行反馈,而不依赖于外部模型(例如学习动作专家、编码Agent或 SAM3 等基础工具)?在这项工作中,我们介绍了 MotorMind,这是一种机器人操纵工具,它将 VLM 提出的中级动作与确定性机器人控制和反馈连接起来,并具有异步监控和后台内存更新功能。在没有特定于任务的策略训练、编码Agent或 SAM3 等额外基础工具的情况下,MotorMind 在基本 LIBERO-PRO 套件上取得了 66.7% 的成功率,在扰动下取得了 53.8% 的成功率,而我们评估的先前零样本方法的成功率分别为 13.3% 和 19.2%。在真实的 xArm6 机器人上,相同的界面在直接操作和人类干扰设置方面的平均成功率达到 95%。用更强大的 VLM 替换主干可以进一步提高性能,而剩余的故障(主要是由于视觉基础、具体推理和动作知识)会随着 VLM 能力的提高而减少。这些结果表明,通用 VLM 在配备适当的中级动作表示和异步执行工具时,可以执行有效的零样本机器人操作。

MotorMind:零样本机器人操作的通用视觉语言模型的脚手架:图1:MotorMind将通用视觉语言模型变为机器人控制器。VLM提出中层动作,例如“向前移动12.20毫米”,随后传递给控制层,由控制层将决策连接到物理执行和反馈。异步监控支持中断待执行动作,结果核验指导恢复与重规划。无需针对任务训练,该设计即可在仿真及现实场景中支持零样本操作。
图1:MotorMind将通用视觉语言模型变为机器人控制器。VLM提出中层动作,例如“向前移动12.20毫米”,随后传递给控制层,由控制层将决策连接到物理执行和反馈。异步监控支持中断待执行动作,结果核验指导恢复与重规划。无需针对任务训练,该设计即可在仿真及现实场景中支持零样本操作。