论文

从扩散到流动:MotionGPT3 中的高效运动生成

From Diffusion to Flow: Efficient Motion Generation in MotionGPT3

应用与实践内容创作

摘要

最近的文本驱动运动生成方法涵盖基于离散标记的方法和连续潜在公式。 MotionGPT3 例证了后一种范例,它将学习的连续运动潜在空间与基于扩散的先验相结合,以进行文本条件合成。虽然整流流目标最近在图像和音频生成中表现出了相对于扩散而言有利的收敛和推理时间特性,但仍不清楚这些优势是否干净地转移到运动生成设置中。在这项工作中,我们进行了一项受控实证研究,比较 MotionGPT3 框架内的扩散和整流流目标。通过固定模型架构、训练协议和评估设置,我们隔离了生成目标对训练动态、最终性能和推理效率的影响。 HumanML3D 数据集上的实验表明,校正流在更少的训练周期内收敛,更早地达到强大的测试性能,并且在相同条件下匹配或超过基于扩散的运动质量。此外,基于流的先验在各种推理步骤计数中表现出稳定的行为,并以更少的采样步骤实现有竞争力的质量,从而提高了效率与质量的权衡。总的来说,我们的结果表明,修正流目标的几个已知好处确实扩展到了连续潜在文本到运动的生成,突出了运动先验中训练目标选择的重要性。