论文

以先验为基础:视觉-语言-引导神经符号模仿学习,实现数据高效的现实世界机器人操作

Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation

摘要

使机器人能够从少量演示中学习长视野操作任务仍然是机器人技术的一个核心挑战。现有的神经符号方法通常依赖于手工制作的符号抽象、语义标记的轨迹或大型演示数据集,限制了它们的可扩展性和现实世界的适用性。我们提出了一个可扩展的神经符号框架,可以从少至一到三十个未注释的技能演示中自主构建符号规划域和数据高效的控制策略,而不需要手动域工程。我们的方法将演示分割为技能,并采用视觉语言模型(VLM)对技能进行分类并识别等效的高级状态,从而能够自动构建状态转换图。该图由答案集编程求解器处理以合成 PDDL 规划域,预言机函数利用该域来隔离每个技能策略的最小、任务相关和目标相对观察和行动空间。策略是在控制参考级别而不是在原始执行器信号级别学习的,从而产生更平滑且噪声更少的学习目标。通过将单个演示投影到场景中的其他对象上,可以利用已知的控制器来增强现实世界的数据,同时丰富图形构建过程和用于模仿学习的数据集。我们主要在真实的工业叉车上通过统计严格的操作试验验证我们的框架,并在 Kinova Gen3 机械臂上跨两个标准基准展示跨平台通用性。我们的结果表明,将控制学习、VLM 驱动的抽象和自动规划合成整合到一个统一的管道中,构成了一条通往可扩展、数据高效、无需专家和可解释的神经符号机器人的实用路径。