论文

StrataVLA:视觉-语言-动作模型的分层高效 3D 几何基础

StrataVLA: Hierarchical and Efficient 3D Geometric Grounding for Vision-Language-Action Models

模型架构Transformer

摘要

视觉-语言-动作 (VLA) 模型继承了大规模视觉语言预训练的强大语义先验,但由于 3D 空间意识不足,在机器人操作方面仍然受到限制。现有的方法要么需要明确的深度或点云输入,要么将几何压缩到训练时监督中,或者仅将其注入模型输入或动作专家,从而使视觉语言骨干无法持续访问与任务相关的空间信息。我们介绍 StrataVLA,这是一个用于分层几何基础的即插即用框架。冻结的几何基础模型从 RGB 观察中提取共享的几何特征,而稀疏的、特定于层的几何适配器允许在选定的主干深度上进行视觉表示,以通过交叉注意力检索相关的几何证据。为了使推理时几何变得实用,StrataVLA 进一步将任务感知路由与 LRU 特征缓存相结合,在任务操作期间利用时间冗余。 LIBERO、SimplerEnv 和现实世界操作的实验表明,与强 VLA 基线相比,获得了一致的增益。 StrataVLA 在 LIBERO 套件上实现了 98.53% 的平均成功率,同时减少了高达 88% 的几何模型调用,将分层几何注入建立为实现具有空间定位能力的机器人控制的有效且高效的方法。