论文
通过合成神经符号监督从视觉语言模型学习结构化机器人策略
Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision
摘要
视觉语言模型(VLM)最近展示了将多模态观察映射到机器人行为的强大能力。然而,当前大多数方法依赖于端到端的视觉运动策略,这些策略仍然不透明且难以分析,限制了它们在现实世界的机器人应用中的使用。相比之下,经典的机器人系统通常依赖于提供可解释性、模块化和反应式执行的结构化策略表示。这项工作研究了如何专门化基础模型来生成基于多模态感知、桥接高维学习和符号控制的结构化机器人策略。我们提出了一种神经符号方法,其中 VLM 根据视觉观察、自然语言指令和结构化系统规范合成可执行的行为树策略。为了在无需手动注释的情况下实现可扩展的监督,我们引入了一个自动化管道,该管道生成域随机场景的合成多模态数据集,并与基础模型生成的指令策略示例配对。通过将受限符号语法下的结构化任务分解与特定于硬件的电机控制解耦,我们证明了 12B 参数模型可以仅通过计算机监控来学习可执行 BT 合成所需的结构化空间符号映射。对两个异构机器人操纵器进行的现实世界物理实验证实,这些结构约束策略实现了到现实世界环境的零样本迁移。结果强调,可以通过程序合成高保真神经符号训练数据来绕过机器人规划中的数据瓶颈。