论文

MixiMotion:通过不对称集合蒸馏一步生成文本到动作

MixiMotion: One-Step Text-to-Motion Generation via Asymmetric Set Distillation

摘要

迭代文本到运动生成可提供高质量且语义一致的运动,但需要多次网络评估,从而导致大量推理延迟。我们提出了 \textbf{MixiMotion},一种基于离线集合蒸馏的严格的一步文本到运动生成框架。 MixiMotion 不是为每个文本提示提取单个教师轨迹,而是构建多个教师动作的离线库,并通过 \textbf{非对称双向匹配} 对齐教师和学生样本集。教师对学生的方向促进了对教师支持的各种运动的报道,而学生对教师的方向则抑制了不受支持的一代人。我们进一步引入可微的解码空间运动学监督,以补充标准化表示与解码运动空间中的约束匹配。在推理时,MixiMotion 通过单个网络评估生成完整的运动序列,无需教师查询、迭代采样或候选排序。在 ViMoGen 上,MixiMotion 获得了 0.835 美元的语义对齐分数,优于评估的单步基线,并接近其 50 步 HY-Motion-1.0-Lite 教师的 0.858 美元分数。在盲人评估中,MixiMotion 的总体评分为 4.33 美元,而老师的评分为 4.50 美元,同时优于评估的单步/数步基线。同时,生成延迟从 $829.58$\,ms 减少到 $9.30$\,ms,相当于 $89.2\times$ 加速。这些结果证明了严格的一步式文本到动作生成的有效质量与效率权衡。