论文

OmniHumanoid:具有无配对适应的流式跨实施例视频生成

OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation

应用与实践内容创作

摘要

跨实体视频生成旨在跨不同的人形实体(例如人到机器人和机器人到机器人)传输运动,从而实现实体智能的可扩展数据生成。这种设置中的主要挑战是运动动力学可以部分地跨实施例转移,而外观和形态仍然是特定于实施例的。现有的方法通常会纠缠这些因素,并且许多方法需要为每个目标实施例提供配对数据,这限制了新机器人的可扩展性。我们提出了 OmniHumanoid,一个分解可转移运动学习和特定于实施例的适应的框架。我们的方法从跨越多个实施例的运动对齐配对视频中学习共享运动转移模型,同时通过轻量级实施例特定适配器仅使用不配对视频来适应新的实施例。为了减少运动转移和实施例适应之间的干扰,我们进一步引入了分支隔离注意力设计,将运动调节与实施例特定的调制分开。此外,我们构建了一个合成的跨实体数据集,其中包含跨不同人形资产、场景和视点渲染的运动对齐配对视频。合成和现实世界基准的实验表明,OmniHumanoid 实现了强大的运动保真度和实施例一致性,同时能够对未见过的人形实施例进行可扩展的适应,而无需重新训练共享运动模型。