论文

PAIR:连接视觉语言动作模型中的感知与动作

PAIR: Bridging Perception and Action in Vision-Language-Action Models

模型训练应用与实践监督微调与指令调优机器人

摘要

视觉-语言-动作(VLA)模型将视觉观察和语言指令映射到连续的机器人动作。此任务需要从描述场景和指令的表示过渡到支持动作生成的表示。许多连续动作 VLA 隐式地保留了这种转换,并主要通过最终动作预测损失对其进行监督。我们引入了 PAIR,一个学习这两个空间之间共享的感知-动作表示的框架。在训练期间,蒙面动作自动编码器将专家动作块编码为水平对齐的动作潜在Token。桥接模块从当前的视觉语言表示中提取与任务相关的特征。 PAIR 将这些功能与动作潜在Token结合起来,形成桥接Token,以保留任务信息并捕获专家动作的结构。然后,桥接Token被投射到动作Token空间中,并注入到初始动作Token中,为动作专家细化提供动作就绪的起点。在推理时,自动编码器被删除,并且桥Token仅根据当前观察和指令生成。 LIBERO、LIBERO-Plus 和 CALVIN ABC-D 上的实验显示了评估的 OpenVLA-OFT 和 VLA-Adapter 模型的增益。在 LIBERO-Plus 上,PAIR 将 VLA-Adapter 的成功率从 59.1% 提高到 64.2%。在 CALVIN 上,它将 VLA-Adapter 的平均完整序列长度从 4.42 增加到 4.53。在七个实际任务中,PAIR 将 OpenVLA-OFT 的成功率从 51.4% 提高到 65.0%。表示分析表明,Bridge Token 保留了任务信息,同时在 Action Expert 细化之前可以访问连续操作信息。这些结果支持共享中间表示作为连续动作 VLA 中感知和动作之间的有用接口。

PAIR:连接视觉语言动作模型中的感知与动作:论文原图
图 1:感知到行动转变的概念视图。标准 VLA 需要操作Token在解码过程中获取和组织与操作相关的信息。相反,PAIR 学习由专家动作结构形成的感知衍生的桥接Token,并将它们注入到初始动作Token中,以便动作专家从动作就绪的中间状态开始,并将其细化为连续控制。动作自动编码器仅在训练期间使用。