论文
G$^3$VLA:视觉-语言-动作模型的几何归纳偏差
G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models
摘要
视觉语言动作(VLA)模型通过利用来自预先训练的视觉语言主干的语义知识,在通用机器人操作方面取得了快速进展,但它们的视觉标记仍然基于二维图像坐标,而不是机器人相机的校准几何结构——这种不匹配在多相机设置中尤其明显,在多相机设置中,视图通过已知的内部和外部耦合,但仍作为独立图像进行处理。我们提出了 G$^3$VLA,一个相机感知的几何模块,它将校准的结构注入到预训练的 VLA 的视觉词元流中,而不改变其动作空间或模仿目标,结合了内在条件射线嵌入、投影位置编码(PRoPE)和双向交叉视图融合。几何监督要么从 真值 点图(如果可用)提供,要么从置信门控 $π^3$X 教师预测提供,无需深度传感器或手动注释。在 $π_0$ 上实例化,G$^3$VLA 在 LIBERO 套件、RoboCasa24、RoboTwin2.0 和真实机器人设置中产生一致的增益,在空间和对象敏感任务上有最大的改进。我们进一步在 $π_{0.5}$ 和 GR00T 1.5 上进行验证,结果表明,当几何感知词元可以直接访问动作生成路径时,几何传输最为有效。我们的项目页面位于 https://sites.google.com/view/g3vla