论文
SepGen:单一模型中的多干音频-视频分离和生成
SepGen: Multi-Stem Audio-Video Separation and Generation in a Single Model
摘要
4D 视听场景由视频、它所描绘的动态几何体以及填充其中的声源组成,每个声源都有自己的位置和轨迹。从新颖的角度渲染这样的场景需要每个源都可以作为单独的波形使用,以便它可以在场景中定位并在信号混合之前传播到观察者。联合音频-视频生成器可以合成视频及其音轨,但音轨作为单个音频混合发出,其中的源无法单独访问。我们提出了 SepGen,它扩展了一个预训练的音频-视频生成器,可以在一次联合采样运行中发出视频、混合音轨以及每个字幕源的一个波形。 SepGen 支持两种互补模式:生成和分离。在生成模式下,每个源标题指定其主干包含的内容。例如,两个说话者的对话,按照原始回合顺序,每个说话者一个主干。在分离模式下,输入音频混合保持干净,而字幕指定要提取的内容,因此模型可以分解 根据自由文本描述进行记录。我们评估从文本合成的场景的生成,以及其他生成器渲染的场景和语音、音乐和声音效果的真实录音的分离。考虑到带有台词的音频混合和字幕,SepGen 的表现优于语言条件分隔符,尤其是在语音方面,并且当台词从字幕中删除时,它保持领先地位。代码、检查点和数据集可在 https://sepgen.github.io/ 获取