论文
检索和提炼基于扩散的运动生成的获胜噪声票证
Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation
摘要
基于扩散的文本到运动模型可以合成真实的人体运动,但通常会表现出与输入文本的语义漂移。运动本质上是时间性的,特别是在组合序列和长时间序列中,这些序列需要跨多个动作片段的语义一致性以及整个轨迹的平滑运动过渡。我们假设初始噪声是这种一致性的核心:在高斯噪声空间内,某些实例(即赢得噪声票)携带潜在结构,即使在空提示下,该结构也会使去噪偏向于特定运动语义。我们提出了 WInning 噪声检索和优化(WINRO),这是一个 无需训练 模型无关的框架,它通过在扩散采样之前选择和细化此类票证来改善文本运动对齐。 WINRO 将随机噪声映射到空提示下生成的运动特征,检索给定文本的最佳对齐噪声,并通过 KL 正则化目标对其进行细化,以减少残留语义间隙,同时保留高斯先验。可选的基于 LoRA 的适配器将这种改进分摊到单个前向传递中。 WINRO 在 HumanML3D 上持续提高不同基础模型、MDM 和 MotionLCM 的文本运动保真度,无需重新训练,提高 MTT 基准的时间鲁棒性,并推广到运动风格化和空间约束满足等应用。