论文

了解几何基础模型对视觉-语言-动作模型的影响

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

模型评测模型行为与机制分析

摘要

最近的工作探索了用于 3D 重建的视觉-语言-动作模型 (VLA) 和几何基础模型 (GFM) 交叉的新机会,例如 VGGT。虽然由此产生的几何 VLA 通常表现出改进的性能,但仍不清楚 (i) 现代 VLA 是否已经具备足够的几何理解能力,(ii) 将几何理解注入 VLA 的最佳架构是什么,以及 (iii) 影响几何 VLA 的其他设计选择的效果如何。在本文中,我们针对 VLA (GR00T-N1.5) 和 GFM (VGGT) 的特定选择提供了严格的实验分析,以阐明这些问题。我们的第一个贡献是通过提供基于线性探测的严格分析,将先前工作的直觉形式化,即当前的 VLA 缺乏几何理解。该分析首次量化了 VLA 和 GFM 之间的“几何差距”。我们的第二个贡献是识别和比较连接 GFM 和 VLA 的不同策略。我们实现了三种不同的架构,它们在 VLA 中注入几何图形的方式有所不同,同时保持低级实现细节尽可能相似,以确保公平的比较。最后,我们分析非架构选择(例如训练数据、摄像机数量、重建质量)对几何 VLA 性能的影响。