论文

直接动作头注入定位 3D 点可解锁空间和任务泛化

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

摘要

视觉语言动作(VLA)模型利用大规模视觉语言预训练来实现灵活的机器人操作,但在测试时,它们对于改变的物体位置以及与不同指令配对的熟悉场景仍然很脆弱。越来越多的方法通过为策略提供定位信号(例如用于对象定位和放置的 2D 像素坐标)来解决这种脆弱性。然而,我们发现定位信号的表示和注入方式比信号本身更重要。在这项工作中,我们提出了一个轻量级模块,它以 3D 形式表示定位信号,并将所得嵌入直接注入到动作头中。该模块是一个两层 MLP,不需要更改 VLA 主干或预训练管道,但它产生的收益比语言或视觉提示替代方案要大得多。在 LIBERO-PRO 上,我们的方法将任务扰动下 GR00T-N1.6 的平均成功率从 31.2提高到 77.5,在位置扰动下从 28.1提高到 60.2。 $π_{0.5}$ 也获得了类似的收益,这表明该机制在具有基于扩散的行动头的 VLA 中是与主干无关的。我们通过实际实验进一步验证了其实际适用性。总之,这些结果支持了我们的中心发现:将足够的 二维定位提升到 3D 并将其注入到动作头中,可以实现 VLA 中的空间和实例级任务泛化。