论文

AuraSE:通过多模态流匹配和推理策略优化实现低幻觉生成语音增强

AuraSE: Low-Hallucination Generative Speech Enhancement via Multimodal Flow Matching and Inference Policy Optimization

应用与实践语音交互与综合语音服务

摘要

与传统的判别方法相比,生成语音增强模型可以产生更清晰、听起来更自然的语音,但即使使用转录调节,也可能会通过改变语音内容或说话者身份而产生幻觉。我们提出了 AuraSE,一种流程匹配框架,通过互补模态和推理设计来解决幻觉问题。首先,双流到单流多模态扩散变压器(MMDiT)允许转录和声学表示相互作用,同时为降级输入保留专用路径。其次,我们发现最佳解码器配置(受制导比例、采样温度和步数控制)在不同的话语中存在很大差异。这一观察结果激发了 Inference 策略 Optimization (IPO),这是一种在线策略偏好优化方法。 IPO 在不同的推理配置下从当前模型中生成多个候选者,用多目标奖励对它们进行排名,并从他们的相对偏好中学习。 AuraSE-IPO 在综合测试集的 12 个指标中的 11 个指标中排名第一,并在真实 DNS 盲测试集上的评估系统中获得最高的 DNSMOS 和盲听分数。在部署时,它使用固定的 $10$ 步 ODE 解码器,无需无分类器指导 (CFG) 或按话语配置搜索。

AuraSE:通过多模态流匹配和推理策略优化实现低幻觉生成语音增强的原论文方法或结果图
图 1:AuraSE 概述。 (左)双流到单流 MMDiT 增强了以转录本为条件的降解梅尔,预测流速。 (中)双流块:mel 和 text token共同参加但保持单独的投影。 (右)IPO 在不同的推理策略下解码每个输入,对候选者进行评分,在缓冲区中形成自生成的偏好对,并在闭环中更新模型。