论文
APT:行动专家预训练提高了视觉-语言-行动策略的指令泛化
APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
摘要
将预训练视觉语言模型 (VLM) 与连续动作专家相结合的视觉语言动作 (VLA) 模型已经实现了强大的操作性能,但对分布外 (OOD) 语言指令的泛化仍然很差。一个已知的挑战是 VLA 数据的结构不平衡,其中语言的多样性远不如视觉和动作内容丰富,这使得政策容易出现视觉捷径。虽然离散动作方法通过视觉语言协同训练来缓解这一问题,但连续动作专家缺乏这样的保护:它们从随机初始化开始,完全从不平衡的数据中学习,产生噪声梯度,破坏 VLM 并无法利用其语言能力。我们从贝叶斯的角度解决这个问题,将策略分解为与语言无关的视觉动作(VA)先验和语言条件的 VLA 可能性,并提出 APT,这是一种强调行动专家预训练的两阶段训练方法。在第 1 阶段,动作专家在冻结的 VLM 中的视觉-动作对上预先训练为 VA,从而绕过了语言不平衡。在第 2 阶段,通过门控融合机制注入语言标记,该机制集成了 VLM 功能,同时保留了学习到的视觉运动先验。 APT适用于主流的VLA架构,包括$π$、GR00T等架构。综合实验验证了 APT 在未见过的指令和组合任务上取得了一致的收益。项目页面:https://xukechun.github.io/papers/APT/