PAIR:连接视觉语言动作模型中的感知与动作
PAIR: Bridging Perception and Action in Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型将视觉观察和语言指令映射到连续的机器人动作。此任务需要从描述场景和指令的表示过渡到支持动作生成的表示。许多连续动作 VLA 隐式地保留了这种转换,并主要通过最终动作预测损失对其进行监督。我们引入了 PAIR,一个学习这两个空间之间共享的感知-动作表示的框架。在训练期间,蒙面动作自动编码器将专家动作块编码为水平对齐的动作潜在Token。桥接模块从当前的视觉语言表示中提取与任务相关的特征。 PAIR 将这些功能与动作潜在Token结合起来,形成桥接Token,以保留任务信息并捕获专家动作的结构。然后,桥接Token被投射到动作Token空间中,并注入到初始动作Token中,为动作专家细化提供动作就绪的起点。在推理时,自动编码器被删除,并且桥Token仅根据当前观察和指令生成。 LIBERO、LIBERO-Plus 和 CALVIN ABC-D 上的实验显示了评估的 OpenVLA-OFT 和 VLA-Adapter 模型的增益。在 LIBERO-Plus 上,PAIR 将 VLA-Adapter 的成功率从 59.1% 提高到 64.2%。在 CALVIN 上,它将 VLA-Adapter 的平均完整序列长度从 4.42 增加到 4.53。在七个实际任务中,PAIR 将 OpenVLA-OFT 的成功率从 51.4% 提高到 65.0%。表示分析表明,Bridge Token 保留了任务信息,同时在 Action Expert 细化之前可以访问连续操作信息。这些结果支持共享中间表示作为连续动作 VLA 中感知和动作之间的有用接口。
