论文

语义与几何定位的解耦:语言条件模仿学习的空间视觉提示

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

摘要

虽然端到端视觉-语言-动作(VLA)模型在机器人操作方面显示出前景,但它们的整体范式本质上将语义推理和空间控制结合在一起。这造成了严重的对齐瓶颈,限制了数据受限的模仿学习中精确的目标消歧。为了克服这个问题,我们提出了 SVP-IL,这是一种解耦架构,可以从动作生成循环中显式地提取空间视觉定位。通过利用视觉语言基础模型,我们将指令解析为零样本几何掩模,将语言转换为明确的空间视觉提示(SVP)。这些先验通过轻量级直接特征级融合机制注入连续动作生成器。这种集成提供了明确且未损坏的空间梯度指导,同时确保低数据状态下的高度稳定的优化。大量实验表明,SVP-IL 的性能显着优于最先进的 VLA 和纯视觉运动基线。经过少至 50 到 100 次演示的训练,SVP-IL 将高度模糊的语言条件任务的平均成功率从 24.0% 提高到 39.5%,在标准基准上达到 67.8%。现实世界的机器人实验进一步验证了其在非结构化物理环境中的稳健性和数据效率。