论文
GaussVLA:视觉-语言-动作模型的几何感知空间推理
GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
摘要
视觉-语言-动作 (VLA) 模型将视觉观察编码为不带有内在几何结构的平面 2D 补丁标记,并通过密集的单眼深度注入每像素标量值来增强它们,这些标量值既不编码表面方向,也不编码几何置信度。这使得该策略用于动作预测的结构化空间推理有限。我们提出了 GaussVLA,一种基于 Mamba 的 VLA,它包含两个自定义模块:高斯空间标记器 (GST),用于将冻结的语义和深度特征提升为紧凑的 3D 高斯标记,通过学习查询池化几何显着区域,以及在语言和流程时间条件下执行结构化、非自回归几何推理的 \emph{深度感知链思想 (DA-CoT)}。在模拟和现实世界评估中,GaussVLA 展示了强大的空间操纵性能,同时保持参数效率。在 LIBERO 上,它实现了 93.5% 的平均成功率,在仅包含 200M 参数的 Spatial 套件上实现了 100.0% 的成功率,比 SpatialVLA 的相对平均成功率提高了 19.7%,同时保持了显着更高的参数效率。