论文

FlowCoMotion:通过词元潜在流建模生成文本到动作

FlowCoMotion: Text-to-Motion Generation via Token-Latent Flow Modeling

应用与实践内容创作

摘要

文本到动作的生成是通过学习动作表示来驱动的,以实现与语言的语义对齐。现有方法依赖于连续或离散运动表示。然而,连续表示将语义与动力学纠缠在一起,而离散表示则丢失了细粒度的运动细节。在这种背景下,我们提出了 FlowCoMotion,一种新颖的运动生成框架,从建模角度统一了两种处理方法。具体来说,FlowCoMotion 采用词元潜在耦合来捕获语义内容和高保真运动细节。在潜在分支中,我们应用多视图 蒸馏 来规范连续潜在空间,而在词元分支中,我们使用离散时间分辨率量化来提取高级语义线索。然后通过词元潜在耦合网络组合来自两个分支的表示来获得运动潜在。随后,根据文本条件预测速度场。 ODE 求解器对简单先验的速度场进行积分,从而引导样本达到目标运动的潜在状态。大量实验表明,FlowCoMotion 在文本转运动基准测试(包括 HumanML3D 和 SnapMoGen)上实现了具有竞争力的性能。