论文
世界飞行员:用世界行动先验指导视觉-语言-行动模型
World Pilot: Steering Vision-Language-Action Models with World-Action Priors
摘要
视觉-语言-动作 (VLA) 模型继承了大规模预训练的语义基础,并且能够胜任分布内操作任务。然而,这种基础是建立在静态图像-文本对的基础上的,而操纵是一个连续的、接触丰富的过程,其动态是预训练无法捕获的。我们提出了 World Pilot,这是一个 VLA 框架,它利用世界行动模型 (WAM) 的先验知识来增强政策,并通过两条互补的路径进入决策链。潜在转向将感知层置于场景演化潜在状态上,而动作转向在动作生成器之前提供预期轨迹作为运动。这两个先验一起为 VLA 配备了场景的预期视图和轨迹级运动提示以及语义调节,并且即使由未经动作后训练的视频预训练世界模型提供,场景进化先验仍然有效。 World Pilot 在 LIBERO-Plus 零样本 OOD 基准上获得了最先进的 84.7% 的总成功率,并且在四个操纵任务的每个真实机器人设置上获得了最高的成功率,在视点、几何形状、可变形状态和姿势的变化下具有最大的成功率。项目网站:https://world-pilot.github.io/