论文

TMD-Bench:音乐—舞蹈联合生成的多层次评测

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

模型评测基准与评测资源

摘要

统一视听生成正在迅速获得工业和创意相关性,从而实现虚拟制作和交互式媒体中的应用。然而,当从一般的音频-视频合成转向音乐-舞蹈联合生成时,任务变得更加困难:音乐节奏、乐句和重音必须以精细的时间分辨率驱动编排运动,而当前评估实践中使用的单模态度量或通用视听一致性分数无法捕获这种节奏耦合。我们推出了 TMD-Bench,这是文本驱动的音乐-舞蹈联合生成的基准,用于评估单模态生成质量、指令依从性和跨模态节奏对齐的系统。该基准将可计算的物理指标与感知多模态判断相结合,并得到精心策划的节奏对齐音乐舞蹈数据集和用于结构化音乐语义的细粒度音乐字幕器的支持。 TMD-Bench 进一步揭示,(i) 现代商业视听模型,如 Veo 3 和 Sora 2,可以产生高质量的音乐和视频,而节奏耦合仍然不太一致优化,并留有改进的空间,(ii) 我们在节奏对齐数据上训练的统一基线 RhyJAM 实现了有竞争力的节拍水平同步,同时保持有竞争力的单模态保真度。这为构建明确优化节奏和动力学连贯性的下一代音乐舞蹈模型提供了前景。