论文
Evo-Depth:轻量级深度增强视觉-语言-动作模型
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
摘要
通过统一感知、语言基础和动作生成,视觉-语言-动作模型已成为机器人操作的一个有前途的范例。然而,它们经常在需要精确空间理解的场景中陷入困境,因为当前的 VLA 模型主要依赖于缺乏深度信息和详细空间关系的 2D 视觉表示。虽然最近的方法结合了深度图或点云等显式 3D 输入来解决这个问题,但它们通常会增加系统复杂性,需要额外的传感器,并且仍然容易受到传感噪声和重建错误的影响。另一项工作是直接从 RGB 观测中探索隐式 3D 感知空间建模,无需额外的传感器,但它通常依赖于大型几何基础模型,从而导致更高的训练和部署成本。为了应对这些挑战,我们提出了 Evo-Depth,这是一种轻量级深度增强型 VLA 框架,可以增强空间空间关联操作,而无需依赖额外的传感硬件或影响部署效率。 Evo-Depth 采用轻量级隐式深度编码模块从多视图 RGB 图像中提取紧凑的深度特征。这些功能通过空间增强模块通过深度感知调制整合到视觉语言表示中,从而实现高效的空间语义增强。进一步引入渐进式对齐训练策略,以将所得的深度增强表示与下游动作学习对齐。仅 0.9B 参数,Evo-Depth 在四个模拟基准测试中就实现了卓越的性能。在实际实验中,Evo-Depth 获得了最高的平均成功率,同时在比较方法中还表现出最小的模型大小、最低的 GPU 内存使用率和最高的推理频率。