论文
文本指挥,音乐装饰:基于能量的可编辑舞蹈动作生成的注意力
Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation
摘要
编排动作生成给人工智能带来了独特的挑战,需要对复杂、时间结构和富有表现力的全身动态进行精确的语义控制。虽然现有模型可以从音乐中合成动作,但它们很大程度上仍然是黑匣子。相反,尝试调节文本和音乐的生成经常会导致模态崩溃,即密集的声学节奏压倒稀疏的语义文本提示,从而破坏用户的可控性。为了解决这种时空冲突,我们提出了 STREAM(基于结构-时间节奏能量的运动注意力),一种模态解耦扩散 Transformer。 STREAM 严格分离调节路径:全局文本语义通过自适应层归一化 (AdaLN) 决定运动结构,而新颖的基于能量的双峰注意力模块 (BEAM) 将这些特征路由到音乐节拍而不覆盖语义。我们进一步介绍 Motorica++,这是一个新策划的数据集,丰富了现有 Motorica 数据集中特定领域的舞蹈词汇和帧级语义注释。此外,为了严格量化零样本可编辑性,我们提出了交换评估协议和可编辑舞蹈分数(EDS)。通过大量的实验,STREAM 在动作和音乐之间实现了最先进的协调,同时完美地保留了编舞语义,将 AI 定位为不仅是反应式合成器,而且是艺术指导的可控协作伙伴。源代码和数据集可在 https://github.com/SeongJong-Yoo/STREAM 获取。