论文
Soundwich:具有分层且可控音频的视频生成
Soundwich: Video Generation with Layered and Controllable Audio
摘要
最近的联合音频-视频生成模型可以合成具有同步声音的逼真视频,但通常将音频生成为单个混合轨道。这限制了源级控制,并且与实际的视听工作流程不同,在实际的视听工作流程中,语音、音乐、音效和环境声音被表示为单独的可编辑轨道。我们引入了 Soundwich,这是一个免训练框架,可将冻结的联合音频-视频流匹配模型转换为与共享视频耦合的多个同步、独立可编辑独立音轨的生成器。 Soundwich 生成单独的独立音轨,并对其时间活动进行明确控制。为了保持单独生成的声音连贯,我们引入了一种共享场景表示,它可以跨音轨传达全局视听上下文,同时保持它们的源级分离。我们进一步路由每个独立音轨与其相应的视觉源之间的跨模态交互,从而提高视听一致性。生成的音轨与视频保持同步,并且可以独立地重新定时、静音、替换或重新混合。实验和人工评估表明时间控制、源分离和自然度得到了改善,同时在连贯的视听生成中实现了灵活的源级编辑。代码可在 https://github.com/CodyNing/Soundwich. 获取