论文

DialogueSidon:从野外对话音频中恢复全双工对话音轨

DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio

应用与实践内容创作

摘要

全双工对话音频(其中每个说话者都录制在单独的轨道上)是口语对话研究的重要资源,但很难大规模收集。大多数野外双说话人对话只能以降级的单声道混合形式提供,这使得它不适合需要干净的说话人信号的系统。我们提出了 DialogueSidon,一种用于联合恢复和分离降级单声道双说话人对话音频的模型。 DialogueSidon 结合了对语音自监督学习 (SSL) 模型特征进行操作的变分自动编码器 (VAE),将 SSL 模型特征压缩到紧凑的潜在空间中,以及基于扩散的潜在预测器,从退化的混合物中恢复说话人的潜在表示。对英语、多语言和野外对话数据集的实验表明,DialogueSidon 在基线上显着提高了清晰度和分离质量,同时还实现了更快的推理。