论文

UniPASE:具有高保真度和低幻觉的通用语音增强生成模型

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations

应用与实践内容创作

摘要

通用语音增强 (USE) 旨在通过多种采样率恢复来自不同失真的语音信号。我们提出 UniPASE,这是专为 USE 定制的低幻觉 PASE 框架的扩展。其核心是 DeWavLM-Omni,这是一个统一的表示级增强模块,通过 知识蒸馏 在大规模监督多失真数据集上从 WavLM 进行微调。该模块直接将降级波形转换为干净且语言上忠实的语音表示,确保以最小的语言幻觉实现稳健的增强。基于这些增强的语音表示,适配器生成包含丰富声学细节的增强的声学表示,神经声码器使用它来重建相应的高保真 16-kHz 波形。然后,PostNet 将波形转换为 48kHz,然后将其重新采样到原始速率,从而能够以多种采样率无缝处理输入和输出。多个评估数据集(涵盖子任务和完整任务)的实验结果表明,与现有最先进的模型相比,UniPASE 实现了卓越或有竞争力的性能。所提出的模型也是我们提交 2026 年紧急挑战赛的支柱,该挑战赛在客观评估中获得了第一名。源代码和音频演示可在 https://github.com/xiaobin-rong/unipase/ 获取。