观察者:让具身模型引领,VLM 对此进行反思
Spotter: Let the Embodied Model Lead, and the VLM Reflect for It
摘要
当前的具身模型不会对自己的失败做出反应,尽管刚刚出现的问题可能会为下一次尝试进行小幅调整,这是语言模型中思维成果背后的反映。我们测试他们是否可以修复已知的错误,这需要产生更正并判断是否正确。在失败时停止并允许重试,他们很少通过自己的随机性或错误的语言描述来修复它,并且 N 中最佳选择无法在失败后选择成功的候选者。我们将其归因于仅对成功的演示进行了训练,并且输入范围太窄,无法显示出了什么问题,并得出结论,反射必须来自视觉语言模型(VLM),该模型吸收了更多信息,例如情节历史和文本,并且更通用。之前以 VLM 为主导的工作对 VLM 进行了规划,并调用具身模型作为工具,将 VLM 置于关键路径上。我们提出了 Spotter,它颠倒了角色:具身模型持续引导和执行,而 VLM 并行运行,通过轻量级本地筛选器进行监控,仅在检测到错误时进行干预,反映并纠正错误,然后返回控制权。我们使用 Qwen 和 GPT 作为 VLM 来运行 Spotter,并且都改进了具身模型;借助 GPT,Spotter 将 RoboCasa 上的 Cosmos 策略和 $π_{0.5}$ 提高了 5.6 和 7.5 个百分点,并将 RoboTwin 2.0 的 Hard 设置上的 $π_{0.5}$ 从 47.2% 提高到 57.0%,在真实机器人上从 53% 提高到 83%。由于 VLM 仅在错误得到确认时才会介入,因此 Qwen 的一次成功发作仅比单独的具身模型长 13 到 16 秒,比使用相同模型的 VLM 主导的基线少约 70% 的时间。我们的代码可在 https://github.com/zqc3117/Spotter. 获取