论文

RotVLA:视觉-语言-动作模型的旋转潜在动作

RotVLA: Rotational Latent Action for Vision-Language-Action Model

摘要

潜在动作模型(LAM)已成为在视觉-语言-动作(VLA)模型预训练期间处理异构数据集的有效范例,提供跨实施例的统一动作空间。然而,现有的 LAM 通常依赖于离散量化编码和解码管道,这可能导致琐碎的帧重建行为、有限的表示能力以及缺乏物理意义的结构。我们引入了 RotVLA,这是一个基于连续旋转潜在动作表示的 VLA 框架。潜在动作被建模为 SO(n) 的元素,提供与现实世界动作动态一致的连续性、组合性和结构化几何。三元组框架学习框架进一步强化有意义的时间动态,同时避免退化。 RotVLA 由 VLM 主干和流匹配动作头组成,在大规模跨实施例机器人数据集和具有潜在动作监督的人类视频上进行了预训练。对于下游机器人控制,流匹配头被扩展为统一的动作专家,联合对潜在动作和机器人动作进行去噪。在这里,潜在行动充当潜在规划者,提供调节行动生成的高级指导。只需 1.7B 个参数和 1700 多个小时的预训练数据,RotVLA 在干净和随机设置下分别在 LIBERO 上达到 98.2%,在 RoboTwin2.0 上达到 89.6% / 88.5%。它还在操作任务上展示了强大的现实性能,始终优于现有的 VLA 模型。