论文

弥合体现差距:解开跨体现视频编辑

Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing

模型训练参数高效训练

摘要

从人类视频中学习机器人操作是解决机器人技术数据瓶颈的一个有前途的解决方案,但人类和机器人之间的分布转移仍然是一个严峻的挑战。现有的方法通常会产生纠缠表示,其中任务相关信息与人类特定的运动学相结合,限制了它们的适应性。我们提出了一种跨实施例视频编辑的生成框架,通过学习明确解开的任务和实施例表示来直接解决这个问题。我们的方法通过强制执行双重对比目标,将演示视频分解为两个正交的潜在空间:它最小化空间之间的相互信息以确保独立性,同时最大化空间内一致性以创建稳定的表示。参数高效的适配器将这些潜在代码注入冻结的视频扩散模型中,从而能够从单个人类演示中合成连贯的机器人执行视频,而不需要配对的跨实施例数据。实验表明,我们的方法可以生成时间一致且形态准确的机器人演示,提供可扩展的解决方案来利用互联网规模的人类视频进行机器人学习。