论文
DeVA:具有物理指导的解耦视频动作模型,用于机器人策略学习
DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning
摘要
可推广的机器人操作需要能够预测视觉场景在执行语言指令时如何演变的策略。虽然最近的视觉-语言-动作模型受益于大规模预训练,但它们主要的静态预训练目标为物理动力学和时间因果关系提供了有限的监督,使得控制相关知识需要从下游机器人演示中学习。视频生成模型通过未来预测对丰富的时空先验进行编码,从而提供了有前景的基础。然而,现有的视频动作模型要么将视频和动作预测耦合在共享主干中,使得策略适应更难优化,要么在指导动作分支时未充分利用视频信息。在这项工作中,我们介绍了 DeVA,一种解耦视频动作模型,具有专门的视频和动作专家、多级特征传输和物理显着指导。 DeVA 将多个视频层的表示传输给行动专家,实现丰富的信息交换,同时使政策学习更容易处理。它通过物理显着指导(可供性/深度)进一步监督中间视频功能和动作流。模拟基准和实际部署的实验证明了有限数据下的强大性能、比统一架构更快的收敛速度以及物理引导带来的明显性能提升。