论文

TeMuDance:基于对比对齐的文本控制,用于音乐驱动的舞蹈生成

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

应用与实践内容创作

摘要

现有的音乐驱动的舞蹈生成方法已经实现了很强的真实感和有效的音频运动对齐。然而,它们普遍缺乏语义可控性,很难通过自然语言描述来指导特定的动作。这种限制主要源于缺乏将音乐、文本和动作联合起来以进行文本条件控制的监督学习的大规模数据集。为了应对这一挑战,我们提出了 TeMuDance,这是一个框架,可以基于文本控制音乐调节的舞蹈生成,而不需要任何手动注释的音乐-文本-运动三元组数据集。 TeMuDance 引入了一种以运动为中心的桥接范式,利用运动作为共享语义锚来在统一的嵌入空间内对齐不相交的音乐-舞蹈和文本-运动数据集,从而能够跨模态检索缺失的模态以进行端到端训练。然后,在冻结的音乐到舞蹈扩散主干上训练轻量级文本控制分支,保持节奏保真度,同时实现细粒度的语义指导。为了进一步抑制检索到的监督中固有的噪声,我们设计了一种具有基于置信度过滤的双流 微调 策略。我们还提出了一种新颖的任务对齐指标,该指标可以量化文本提示是否在音乐条件下诱导预期的运动学属性。大量实验表明,TeMuDance 实现了有竞争力的舞蹈质量,同时大大改进了对现有方法的文本条件控制。