论文
V-Link:恢复视觉-语言-动作模型的 Action DiT 中丢失的视觉表征
V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型通过集成视觉感知、语言理解和连续动作控制,为通用机器人操作提供了一条可扩展的路径。然而,我们揭示了 VLA 架构的一个关键限制:动作专家对 VLM 特征中可用的 3D 几何和 2D 语义信息的访问有限。这种可访问性差距削弱了感知基础并限制了细粒度机器人操作的性能。为了解决这个问题,我们提出了 V-Link,它在视觉语言 (VL) 到动作 (A) 特征传输期间显式恢复视觉表示。具体来说,V-Link 学习 VLM 内互补的空间和语义查询表示,并通过不对称路径将它们注入到 Action DiT 中。语义查询补充了原始的 VLM 图像标记,而空间查询则为基于空间的动作生成提供了专用的几何条件。在 LIBERO、LIBERO-Plus 和 RoboTwin 2.0 中,我们的 V-Link 比基本型号 GR00T N1.6 的平均成功率分别提高了 +1.9%、+31.2% 和 +18.8%。在 AGIBOT A3 Ultra 上,V-Link 在两项现实世界的人形任务中进一步实现了 +20% 和 +24% 的增益。