论文
SingDance:具有角色感知音频调节的组合零镜头歌舞视频生成
SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning
摘要
从参考图像、文本提示和音轨生成个性化舞蹈视频需要根据音乐调节身体动作。载歌载舞还增加了第二个要求:可见的主体也必须清晰地表达声音。现有的音乐调节方法主要集中在编排上,而语音驱动模型通常假设可见主体产生输入声音,因此这种组合设置在很大程度上尚未得到充分探索。我们引入了 SingDance,一个统一的视频传播框架,它将可控的声音清晰度制定为语义角色:可见主体要么是产生声音信号的源,要么是从屏幕外表演者接收声音信号的听众。硬紧凑路由选择与任务相关的语音、音乐和角色条件,这些是通过逐帧联合音频注入组成的;源和听者保留相同的语音路径。训练采用不对称监督:屏幕上的讲话和精心策划的屏幕外对话响应视频建立了角色控制,而器乐和基于歌曲的舞蹈视频则建立了音乐条件下的身体运动。在训练期间永远不会观察到目标歌曲/源配置。由此推论,将源角色分配给歌曲可以分别学习发音和歌曲调节的舞蹈能力,从而实现组合零镜头唱跳。实验证明了强大的运动——节拍对齐和视觉保真度,可靠的发声配对切换,同时保留音乐对齐的身体运动,以及高度竞争性的唇同步,其生成时间参数比评估的最强语音驱动基线少得多。