论文

GeoBridge-VLA:视觉-语言-动作模型的几何感知残差适应

GeoBridge-VLA: Geometry-Aware Residual Adaptation for Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)模型对来自视觉-语言预训练的语义信息进行编码,但操作也需要精确的空间推理。我们提出了 GeoBridge-VLA,这是一种两阶段方法,用于从预训练的VLA的冻结视觉编码器中学习几何特征并将其用于动作预测。第一阶段训练具有深度监督的特征桥和几何解码器。第二阶段冻结这些模块,并与动作侧预测和动作专家一起训练门控残差接口。残差增强了现有的视觉token,而无需添加第二个图像编码器或增加token计数。部署需要 RGB、机器人状态和语言,但不需要深度观察。在匹配的评估条件下,GeoBridge-VLA在 LIBERO 上取得了 70.9% 的成功率,而 SmolVLA的成功率为 60.0%。在相同训练的检查点中禁用残差会将成功率从 70.90% 降低到 69.85%,并且跨套件的效果参差不齐。在物理 ROBOTIS OMY 机器人上,GeoBridge-VLA在四项任务的 200 次试验中成功完成了 148 次(74.0%),而 SmolVLA在 200 次试验中成功成功 108 次(54.0%)。

GeoBridge-VLA:视觉-语言-动作模型的几何感知残差适应的原论文方法或结果图
图 2:VLA策略中的几何集成。 (a) 纯 RGB VLA使用其视觉token进行动作调节。 (b) 分离深度设计添加了第二个 RGB 编码器和融合模块。 (c) GeoBridge-VLA共享本机视觉编码器,通过特征桥和基于 K4 的几何解码器解码几何,并向现有视觉token添加学习残差。为了清楚起见,此处省略了语言和机器人状态输入。