论文
AuraSE:通过多模态流匹配和推理策略优化实现低幻觉生成语音增强
AuraSE: Low-Hallucination Generative Speech Enhancement via Multimodal Flow Matching and Inference Policy Optimization
摘要
与传统的判别方法相比,生成语音增强模型可以产生更清晰、听起来更自然的语音,但即使使用转录调节,也可能会通过改变语音内容或说话者身份而产生幻觉。我们提出了 AuraSE,一种流程匹配框架,通过互补模态和推理设计来解决幻觉问题。首先,双流到单流多模态扩散变压器(MMDiT)允许转录和声学表示相互作用,同时为降级输入保留专用路径。其次,我们发现最佳解码器配置(受制导比例、采样温度和步数控制)在不同的话语中存在很大差异。这一观察结果激发了 Inference 策略 Optimization (IPO),这是一种在线策略偏好优化方法。 IPO 在不同的推理配置下从当前模型中生成多个候选者,用多目标奖励对它们进行排名,并从他们的相对偏好中学习。 AuraSE-IPO 在综合测试集的 12 个指标中的 11 个指标中排名第一,并在真实 DNS 盲测试集上的评估系统中获得最高的 DNSMOS 和盲听分数。在部署时,它使用固定的 $10$ 步 ODE 解码器,无需无分类器指导 (CFG) 或按话语配置搜索。
