论文
镜像学习
Mirror Learning
摘要
我们通过第三人称观察的视角研究模仿学习,并提出镜像学习的框架:从被动观察中获取可行的政策。虽然行为克隆(BC)在密集、一致的第一人称数据下表现出色,但它从根本上无法利用人类和动物经常利用的第三人称演示所产生的丰富观察信号。我们介绍了一种方法,该方法由以下部分组成:(i)学习的透视变换,使用微调的视频扩散模型将学习者置于演示者的位置,以及(ii)逆动力学模型,推断学习者控制空间中的动作轨迹。这使得能够合成镜像数据,即根据对示威者行为的第三人称观察生成的伪第一人称专家数据。根据经验,我们表明仅镜像数据就可以训练有效的策略,并且利用镜像数据增强第一人称BC训练可进一步提高下游策略性能。我们的结果表明,现代生成世界模型隐式编码了足够的结构,以实现可扩展且安全的替代远程操作密集型数据收集的方案。