论文
Veo-Act:利用前沿视频模型增强 VLA 政策
Veo-Act: Enhancing VLA Policies with Frontier Video Models
摘要
视频生成模型可以产生描述对象运动和交互的连贯视觉序列。我们研究前沿视频生成模型如何补充视觉-语言-动作策略,以增强通用的机器人操作。 VLA 策略已成为机器人学习的主导范式,但它们对预训练 VLM 的面向行动的适应可能会削弱语义泛化,限制模糊或分布外操作场景中的鲁棒性。我们使用视频模型作为视觉规划器,其动机是它们具有泛化复杂场景的潜力以及它们相对于手部运动的先验。然而,基于视频模型的操纵方法通常缺乏底层灵巧交互所需的精度和时间响应能力。为了解决这一差距,我们提出了 Veo-Act,这是一个分层框架,其中 Veo-3.1 作为高级运动规划器,VLA 策略作为低级执行器。多头逆动力学模型将生成的帧对转换为动作,并学习交互门以触发切换到反应性 VLA 控制。模拟实验和真实机器人实验表明,在新颖且语义复杂的操作设置中,与基线 VLA 相比,指令遵循能力和整体任务成功率有所提高,支持视频规划和反应式交互的互补作用。