论文

OmniDance:利用大规模互联网数据生成多模式驱动的舞蹈视频

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

应用与实践内容创作

摘要

音乐驱动的舞蹈视频生成旨在合成具有表现力的人体动作,在时间上与音乐保持一致,同时保持高视觉保真度。尽管最近取得了进展,现有方法仍然面临两个关键限制:缺乏大规模、高质量的舞蹈视频数据集,以及缺乏将音乐作为补充调节信号集成到视频生成基础模型中的原则框架。为了解决这些限制,我们引入了 CIPE-Dance,这是一个大规模的互联网来源的舞蹈视频数据集,带有编排信息文本注释,通过渐进式专家管道构建。据我们所知,CIPE-Dance 是迄今为止最大的舞蹈视频生成数据集,包含超过 400 小时的 30 万个高质量剪辑,涵盖不同的舞者、环境和舞蹈流派。我们进一步提出 OmniDance,这是一种框架级配方,用于将音乐集成到 TI2V 基础模型中,而不牺牲其原始的可控性或视觉保真度。在文本作为低频语义和音乐作为高频时间动态的互补作用的推动下,OmniDance 共同设计了深度感知的专业化架构、锚定的由易到难的课程学习策略和模态专业的时间相关 CFG 策略,从而实现统一的 TI2V、MI2V 和 MTI2V 生成。 CIPE-Dance 上的大量实验表明,OmniDance 在所有三项任务中均实现了最先进的性能,并展现了强大的多模态集成能力。项目可在 https://github.com/AMAP-ML/OmniDance 获取。