论文
统一视觉运动目标:监督身体动作之外的 VLA
Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions
摘要
VLA 模型经过训练,可根据视觉和语言观察来预测机器人动作。这是一个自然的选择,但它会造成不匹配:VLM 编码场景和目标的丰富、高层表示,而机器人动作是任务结构有限的底层信号。我们询问改变策略的训练预测内容(而不是其架构设计方式)是否可以产生更好、更有效的训练策略。我们提出了 UVT(统一视觉运动目标),这是一种统一的潜在预测目标,联合编码运动控制和视觉场景转换信息,不需要架构更改,也不需要额外的数据。 UVT 应用于跨模拟基准和真实双手操作任务的两个代表性 VLA 系统,提高了训练效率、最终任务性能和策略稳健性,在有限的训练预算和具有挑战性的环境条件下取得了特别强劲的收益。我们的项目网页提供了执行视频和其他定性结果:https://unified-visuomotor-targets.github.io/