论文
GeoAlign:超越语义与 VLA 模型中的状态引导空间对齐
GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models
摘要
当前的视觉-语言-动作(VLA)模型通常针对语义基础进行优化,而可执行操作需要几何感知的空间对齐和动态可供性选择。我们引入了 GeoAlign,这是一种用于 VLA 政策学习的国家引导的空间对齐架构。 GeoAlign 使用机器人域 RGB-D 监督对 RGB 几何分支进行后训练,产生用于策略执行轨迹的 RGB 派生几何增强后训练 (GEP) 功能。机器人的本体感受状态查询 GEP 特征网格,生成紧凑的、与相位相关的几何标记以用于动作预测。 GeoAlign 在 LIBERO 上实现了 99.0%,在三个 SimplerEnv-Fractal 任务上实现了 85.3%,在八个几何关键的现实世界 ALOHA 任务上实现了 78.8%,并通过消融确认了几何 后训练 和本体感受状态引导查询的价值。