论文

弥合稳定性与表现力之间的差距:低资源口语模型的合成数据缩放和偏好调整

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

模型训练合成数据

摘要

通过绕过显式的字素到音素管道,口语语言模型 (SLM) 已成为语音合成的一种有前途的范例。然而,它们在资源匮乏的语言中的有效性仍然从根本上受到转录语音稀缺的限制。在实践中,合成数据已成为在此类环境中扩展 SLM 的主要策略,在真实数据不足时提供可靠的语音监督。在这项工作中,我们表明这种依赖引入了一种基本的权衡,我们将其称为稳定性与表现力差距:虽然合成数据提高了语音准确性,但它逐渐抑制了韵律变异性,最终导致表现力崩溃(合成侵蚀)。为了弥补这一差距,我们提出了两个自我调整框架。解缠结引导自对齐 (DGSA) 通过利用韵律-音色分离来恢复复杂语言的表达能力。对于真实参考资料极其有限的情况,温度驱动自我批评 (TDSC) 通过自动探索​​和过滤来稳定生成。我们的方法优于强大的商业系统,包括 ElevenLabs 和 Gemini Pro,并为 Lao 实现了第一个零样本语音克隆功能。