论文

SAVLA:用于机器人操作的对称感知视觉语言动作模型

SAVLA: Symmetry-Aware Vision-Language-Action Models for Robotic Manipulation

模型架构新型架构

摘要

视觉-语言-动作(VLA)模型已成为语言条件机器人操作的主导范例。然而,尽管图像和语言指令本质上编码了几何信息,但 VLA 纯粹从演示中获得其空间能力。因此,它们仅在演示涵盖的场景姿势范围内才可靠。我们提出了 SAVLA,一种端到端对称感知的 VLA 模型,用于稳健且数据高效的策略学习。我们的方法使预训练的视觉语言主干完全冻结,同时将其与等变流匹配动作头和学习的标准化器相结合。头部将其状态、动作和调节输入分解为不变和等变通道,并在其所有层中保留这种类型。规范化器将倾斜视图图像转换为规范框架并一致地旋转几何条件。我们在 LIBERO 上评估我们的模型。与 GR00T N1.5 基线相比,SAVLA 将所有四个 LIBERO 套件的平均成功率提高了 5.1 个百分点,并将 LIBERO-Goal 轮换的平均成功率从 41.5% 提高到 90.4%。