论文
VEGA:空间感知视觉语言动作模型的视觉编码器几何对齐
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
摘要
精确的空间推理是机器人操作的基础,但当前视觉语言动作 (VLA) 模型的视觉主干主要是在 2D 图像数据上进行预训练,没有明确的 3D 几何监督,导致缺乏准确的空间感知的表示。现有的隐式空间基础方法通过将 VLA 特征与 3D 感知基础模型的特征对齐来部分解决这个问题,但它们依赖于经验层搜索并在 LLM 级视觉标记上执行对齐,其中空间结构已经与语言语义纠缠在一起,限制了通用性和几何可解释性。我们提出了 VEGA(视觉编码器几何对齐),这是一个简单而有效的框架,可直接将 VLA 视觉编码器的输出与 DINOv2-FiT3D 的空间感知特征对齐,DINOv2-FiT3D 是一个通过多视图一致的 3D 高斯泼溅监督进行微调的 DINOv2 模型。通过在视觉编码器输出级别执行对齐,VEGA 在发生任何语言纠缠之前奠定空间意识,提供更可解释和更有原则的对齐目标。对齐是通过一个轻量级投影仪来实现的,该投影仪经过余弦相似性损失和标准动作预测目标的训练,并在推理时被丢弃,不会引入额外的计算开销。对模拟基准和现实世界操作任务的大量实验表明,VEGA 始终优于现有的隐式空间几何对齐基线,为 VLA 模型的隐式空间几何对齐方法建立了新的最先进技术。