论文
重建过程丢失的语义:使VLA动作表示与语言对齐
Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models
摘要
动作动词不仅描述动作的物理结果,还描述这些动作是如何执行的。然而,视觉-语言-动作模型(VLA)中的动作表示通常针对原始动作空间中 L1/L2 损失下的重建进行优化,其中数值接近度不需要反映语言上有意义的区别。在 BridgeV2 上,我们表明动作轨迹包含超出视觉状态变化的动词基础信息,并且仅重建的离散标记化系统地侵蚀了这些信息。为了解决这个问题,我们引入了 SALT,一种语义对齐的动作分词器,它通过一个辅助目标来增强 VQ-VAE 风格的分词器,需要冻结的视觉语言模型来从量化的动作潜伏中恢复情节指令。使用 SALT 训练的策略在 SimplerEnv 中平均成功率为 71.9%,而仅重建 VQ-VAE 标记器为 42.7%,FAST 为 31.2%。 SALT 还开发了动词专用代码,同时保持重建保真度。这些结果表明,机器人动作轨迹提供了语言基础的来源,并且在动作表示中保留这种结构可以显着改善语言条件控制。