论文
根据野外先验生成参考驱动的多说话人音频场景
Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors
摘要
现有的多说话人对话系统通过结构化监督将说话人与话语绑定:每回合标签、多流转录或可学习的说话人嵌入。这些系统在纯语音管道中运行,产生干净的声音序列,没有真实对话的环境纹理。我们采取不同的方法。我们的方法 ScenA 以文本到音频流匹配基础模型为条件,该模型在大规模野外数据上进行了预训练,直接在多个参考语音和描述整个多说话人音频场景的自由形式自然语言提示上进行了预训练。利用这样的基础模型,我们可以继承其自然的、非工作室音频的能力:背景噪声、室内声学、重叠对话和自发的副语言事件,同时添加多说话人控制,而无需任何每轮结构。具体来说,参考潜在变量被连接到模型的标记序列中,并通过轻量级身份感知位置编码来区分。然而,我们发现了这种方法的一个关键障碍:\textit{参考快捷方式}。在标准噪声计划下的训练过程中,模型可以通过与噪声目标的声学相似性来识别匹配参考,完全绕过文本提示。我们通过高噪声偏差的时间步长分布来解决这个问题,该分布迫使模型依赖文本提示来分配说话者。我们在 CoVoMix2-Dialogue 基准上评估了 ScenA,结果表明它在说话者绑定指标方面优于现有的多说话者系统,同时生成具有重叠语音、情感发声和环境声音的丰富对话音频。我们的结果证明了使用以自由形式场景描述为条件的通用音频模型的优势,而不是通过纯语音管道传递结构化对话脚本。