论文

寄生共去噪:在冻结视频扩散模型中解锁3D人体动作生成

Parasitic Co-Denoising: Unlocking 3D Human Motion Generation in a Frozen Video Diffusion Model

应用与实践视觉感知与空间理解

摘要

尽管从未被显式3D动作监督,大规模文本到视频扩散模型在其生成的视频中合成逼真的人体运动。我们追问:能否不训练单独的动作模型就把这种隐式知识转化为显式3D动作生成?对冻结Wan2.1的探查显示:可恢复的动作信号存在于其跨越整个去噪排程的中间状态中,不限于干净输出。受此启发,我们引入寄生共去噪范式:动作从宿主模型沿其去噪排程被解码,而非由独立生成器产生。我们把它实例化为寄生动作解码器(PMD)——高效的流匹配解码器,共享宿主噪声排程,经σ自适应多层融合读取其中间特征,宿主保持不变。PMD的覆盖来自宿主而非动作数据,在文本-动作对齐上以很小一部分可训练参数领先专用动作生成器,同时单次通过产生配对的视频与动作——纯动作基线无法匹敌。