论文
CLAP:跨实施例视频世界模型是零镜头物理模拟器
CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
摘要
最先进的动作条件视频模型通常仅限于单个机器人实施例,从而阻止它们利用包含丰富信号的庞大异构视频数据语料库来学习可推广的物理学。为了弥补这一差距,我们引入了 CLAP,这是一种跨实体动作条件视频生成框架,能够在人类和机器人代理的各种互联网规模视频上进行训练。 CLAP 的基础是这样的见解:无论参与者是谁,普遍的物理定律都支配着时空动力学。然而,跨实体学习并非易事,因为动作表示在机器人平台上差异很大,并且通常在人类视频中不存在。 CLAP 通过以下核心贡献应对这一根本挑战。首先,CLAP 使用末端执行器姿势、语言指令和潜在动作来协调不同的动作空间。其次,为了解决其个体局限性,CLAP 引入了一种基于课程的跨实体学习方法,首先使用潜在动作在未标记的视频数据中学习基础物理先验,然后将它们置于末端执行器动作空间中,以便零样本部署到现实世界的任务。至关重要的是,CLAP 在 DROID 等具有挑战性的环境中接近或超越了最先进的单实施视频模型。这些性能优势通过几次镜头适应得到复合,为训练单实施视频世界模型建立了一种新颖的范例。最终,CLAP 提供了迄今为止最全面的动作调节视频世界模型套件 - 跨越不同的动作调节空间(末端执行器、语言和潜在)和机器人形态(包括跨实体、DROID、Bridge、双手 YAM 机器人和 G1 类人机器人)。我们开源所有代码和模型。项目网站 https://omni-clap.github.io 。