论文
Wan-Dancer:分钟级连贯音乐舞蹈生成的分层框架
Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation
摘要
直接从音乐生成持续时间长、高清且节奏同步的舞蹈视频仍然是一项重大挑战,主要是由于当前扩散模型的时间限制,该模型通常会在超过 20 秒后失败。现有的方法,无论是依赖中间 3D 骨架还是端到端视频合成,当扩展到更长的视野时,都会遇到时间漂移、身份不一致和重复运动模式的问题。为了解决这些限制,我们提出了一种新颖的分层框架,用于分钟级连贯的音乐到舞蹈的生成。我们的方法将过程分解为全局关键帧规划和局部时间细化,利用全轨音乐背景来确保远程连贯性。主要创新包括通过时间映射 RoPE 嵌入进行动态帧速率自适应以实现精确对准、基于光流的损失函数以增强运动连续性,以及运动速度控制以在快速运动过程中保留高保真细节。大量的实验表明,我们的框架超越了传统的持续时间障碍,生成了超过一分钟的稳定的 720p/30fps 视频,并且具有卓越的时间稳定性。此外,该模型在五种不同的舞蹈流派中表现出强大的多功能性,以音频和文本提示为条件,在连贯的长格式舞蹈视频合成中建立了新的最先进技术。