论文
两座桥梁,一条途径:从 VLM 到具有具体轨迹耦合数据的通用 VLA
Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data
摘要
视觉语言模型 (VLM) 是强大的通用推理器,但将它们转换为机器人控制策略 (VLA) 却异常困难。根本原因是两个方面的差距:VLM 接受具有语言理解目标的互联网规模图像的训练,而 VLA 必须感知机器人场景并预测运动动作。 微调 直接针对机器人动作数据的 VLM 迫使模型同时跨越两个差距——学习曲线很陡,并且在预训练期间学到的丰富泛化往往会退化而不是迁移。我们认为,可以通过正确的中间数据逐渐弥补这一差距。我们引入\emph{体现轨迹耦合(ETC)数据}——源自用于动作学习的相同机器人场景和轨迹的视觉语言监督。由于 ETC 数据共享机器人操作的视觉上下文,同时保留熟悉的语言理解目标,因此它在 VLM 预训练和 VLA 微调 之间提供了天然的垫脚石。在此基础上,我们设计了一个三阶段的训练方案。 Distribution Bridging 首先使 VLM 适应具体的视觉语言语义。然后,目标桥接逐渐将模型转向动作预测,同时保留所获得的表示。保持性适应最终将策略专门针对目标部署域。我们进一步表明,将任务相关的分布外 ETC 数据与少量动作数据混合,使模型能够泛化到新颖的视觉语言条件,而无需额外的机器人演示。仿真和真实机器人实验证实,这种渐进桥接策略是将 VLM 泛化转化为稳健、可部署的机器人策略的关键。