论文

World2Motion:将视频世界模型转变为 3D 人体运动发生器

World2Motion: Turning Video World Models into 3D Human Motion Generators

模型训练监督微调与指令调优

摘要

我们提出了 World2Motion,这是一个可以从单个图像和文本提示生成场景感知 3D 人体运动和相应视频的框架。虽然现有的 3D 运动生成器从运动数据集中学习,但其泛化能力受到环境覆盖范围有限的限制。相比之下,Cosmos 3 等视频世界模型提供了更广泛的环境先验,但并不是为全身运动生成而设计的;从生成的视频中恢复运动需要昂贵的两阶段推理。为了解决这些问题,我们将 Cosmos 3 转变为单级 3D 运动发生器。这种适应有两个挑战:配对视频运动数据的稀缺性和生成运动的时间不稳定性。首先,我们构建一个训练数据集,将合成视频运动对与真实视频以及估计的 3D 运动配对。其次,我们提出了一种移位解耦噪声方案,通过共享去噪进程为视频和运动分配不同的噪声级别。这种设计适应了两种模式的不同降噪要求,减少了运动抖动。多源交互基准测试表明,与评估的 3D 运动生成器相比,World2Motion 具有更好的运动文本对齐和场景交互。它还与两阶段基线的交互成功率相匹配,同时推理速度提高了约 3.3$\times$。我们的项目页面位于 https://fyantu.github.io/World2Motion/.