论文

超越世界坐标系动作头:面向视觉-语言-动作模型的运动中心动作坐标系

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

模型架构新型架构

摘要

视觉-语言-动作(VLA)模型凭借更强的骨干网络、更广泛预训练和更大的演示数据集迅速发展,但其动作头仍高度同质化:大多数直接在固定的世界坐标系中预测动作指令。我们提出MCF-Proto,一种轻量级动作头,为VLA策略配备运动中心动作坐标系(MCF)和基于原型的动作参数化。在每一步,策略预测一个旋转 $R_t \in SO(3)$,在变换后的局部坐标系中从一组原型组合出动作,再将其映射回世界坐标系以进行端到端训练,仅使用标准演示而无需辅助监督。这一简单设计诱导出稳定的涌现结构。在没有显式方向标签的情况下,学到的局部坐标系形成了稳定的几何结构,其各轴与演示的末端执行器运动高度一致。同时,在该学到的表示中的动作变得明显更紧凑,变化由更少的主方向捕捉,并被共享原型更有规律地组织。这些结构性质转化为更好的鲁棒性,尤其是在几何扰动下。我们的结果表明,为动作头添加轻量的几何与组合结构,能够切实改进VLA策略组织和泛化机器人操作行为的方式。匿名代码仓库已在补充材料中提供。

超越世界坐标系动作头:面向视觉-语言-动作模型的运动中心动作坐标系:论文配图
图 1:MCF-Proto 的动机。当在固定的世界框架中表达时,类似的操作行为可能会显得非常不同,但在学习的运动中心框架(MCF)中会变得更好。通过将本地框架与基于原型的动作组合相结合,MCF-Proto 产生了更紧凑和结构化的动作表示,更容易在任务之间共享并在几何变化下进行传输。