论文
GeoBridge-VLA:视觉-语言-动作模型的几何感知残差适应
GeoBridge-VLA: Geometry-Aware Residual Adaptation for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型对来自视觉-语言预训练的语义信息进行编码,但操作也需要精确的空间推理。我们提出了 GeoBridge-VLA,这是一种两阶段方法,用于从预训练的VLA的冻结视觉编码器中学习几何特征并将其用于动作预测。第一阶段训练具有深度监督的特征桥和几何解码器。第二阶段冻结这些模块,并与动作侧预测和动作专家一起训练门控残差接口。残差增强了现有的视觉token,而无需添加第二个图像编码器或增加token计数。部署需要 RGB、机器人状态和语言,但不需要深度观察。在匹配的评估条件下,GeoBridge-VLA在 LIBERO 上取得了 70.9% 的成功率,而 SmolVLA的成功率为 60.0%。在相同训练的检查点中禁用残差会将成功率从 70.90% 降低到 69.85%,并且跨套件的效果参差不齐。在物理 ROBOTIS OMY 机器人上,GeoBridge-VLA在四项任务的 200 次试验中成功完成了 148 次(74.0%),而 SmolVLA在 200 次试验中成功成功 108 次(54.0%)。
