论文
将 VLM 的智能转移到机器人控制
Transferring the Intelligence of VLMs to Robotic Control
摘要
人类可以无缝地适应物理世界和数字世界,这表明虽然在具体化、环境和任务中存在数字与现实的差距,但人类智能本身可以跨越这一差距。这自然提出了一个基本问题:视觉语言模型(VLM)的智能是否可以类似地从数字世界推广到物理世界以进行机器人控制?我们通过 RoboDawn 来研究这个问题,这是一个人类直观的界面,它通过一组紧凑的离散平移、旋转和夹具命令将机器人控制暴露给代理 VLM。使用此接口,VLM 在闭环中控制机器人:它观察当前的视觉状态,推理下一个动作,执行该动作,并使后续决策适应结果状态。此外,我们还介绍了一种情境学习 (ICL) 方案,该方案使用一些演示来为 VLM 的界面使用和任务解决策略奠定基础。 RoboTwin 2.0 C2R 和 RoboDojo 上的实验表明,RoboDawn 无需进行特定任务的机器人训练即可实现强大的性能。在零样本设置中,RoboDawn 的性能优于在基准特定机器人数据上训练的多个强大策略,而单个上下文演示进一步产生了显着的性能提升并建立了最先进的 (SOTA) 结果。在 RoboTwin 2.0 C2R 上,成功率从零射击的 53.2% 提高到单射击的 73.6%,超过了可靠基线 {\pi}0.5 (46.0%)。在 RoboDojo 上也观察到了类似的收益,成功率从 35.67% 零次成功提高到 47.17% 一次成功。同样的框架也适用于现实世界的机器人,在 Franka 上执行“篮中积木”和“积木堆叠”。