论文
使用 VLM 代理进行情境机器人学习
In-Context Robot Learning with VLM Agents
摘要
让机器人像人类一样轻松适应陌生的环境仍然是实体人工智能的一个宏伟目标。没有有限的演示集合可以涵盖机器人将遇到的所有任务和情况,因此在部署时从上下文中学习的能力对于泛化至关重要。然而,这种情境学习(ICL)在很大程度上仍然超出了现有机器人政策的范围。 GPT-6 Astra 等商业视觉语言模型 (VLM) 的广泛代理能力提出了一个引人注目的问题:这些模型能否从演示、示例和交互反馈中学习,然后将这些信息从新的初始状态转换为可执行和可验证的机器人行为,而无需梯度更新或对特定任务参数的持续更改?我们介绍 GPT-Policy,一个用于上下文机器人学习的通用代理框架。 GPT-Policy 集成了一个上下文编译器(保留与任务相关的视觉转换)、一个建议机器人工具操作的 VLM,以及一个验证和执行每个操作并报告其结果的受约束控制器。我们通过任务成功和效率指标、模型之间的匹配比较以及受控上下文消融来评估其可靠性和局限性。在真实的机器人试验中,即使没有机器人动作标签,人类视频演示也可以提高任务完成率,而对齐的动作参考可以进一步提高接触敏感任务的效果。这些发现将 GPT-Policy 定位为通过上下文学习实现机器人适应的一个步骤,为将 VLM 的通用功能转化为物理行为提供了经验基础,并阐明了可靠部署必须克服的挑战。