论文
通过统一的指导框架增强流程匹配,实现高效、稳健的语音合成
Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis
摘要
流匹配 (FM) 已成为语音生成的强大范例,但仍然受到高推理延迟和音色泄漏的限制。为了解决这些瓶颈,我们提出了一个统一的指导框架,通过两种互补的策略来提高生成效率和稳健性。在数据方面,我们通过异构增强引入数据引导,鼓励模型将语言内容与声学残留分开。与此同时,我们提出了一种增强的模型引导机制,该机制将轨迹校正与新颖的内在引导目标相结合。这种方法将条件知识提炼为网络权重并拉直推理轨迹路径,从而消除无分类器指导(CFG)开销。实验表明,与最先进的基线相比,我们的框架将推理速度提高了近三倍,同时有效提高了说话人的相似度。