论文

EquiVLA:面向旋转等变视觉语言动作模型的框架

EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models

模型架构Transformer

摘要

视觉-语言-动作(VLA)模型已成为通用机器人操作的强大范例,但它们缺乏几何归纳偏差:在特定方向上训练的策略需要更多的数据才能跨旋转配置进行概括。我们提出 \textsc{EquiVLA},第一个用于端到端 $\mathrm{SO}(2)$ 等变VLA 模型的通用框架,适用于将冻结视觉语言主干与流匹配扩散 Transformer 动作头耦合的任何架构。 \textsc{EquiVLA} 引入了 \textsc{EquiPerceptor},它从冻结的 ViT 特征中产生大约 $\mathrm{SO}(2)$ 等变的视觉表示;和 \textsc{EquiActor},一个精确的 $\mathrm{SO}(2)$ 等变流匹配扩散 Transformer 动作头。他们共同建立了从摄像机观察到预测动作序列的近似 $\mathrm{SO}(2)$ 等变性链。在 GR00T~N1.5 上实例化,并在四个 LIBERO 套件、CALVIN ABCD$\to$D 和 Mobile ALOHA 上的五个真实机器人任务上进行评估,\textsc{EquiVLA} 在 LIBERO 上实现了 $92.6\%$ 平均成功(相对于 $78.1\%$ 基线),在 CALVIN 上平均序列长度为 $4.03$(相对于 $3.45$),并且改进真实机器人的成功从 $54\%$ 到 $72\%$。