论文
DialectS2S:资源匮乏的汉语方言的端到端语音对话建模
DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects
摘要
目前的端到端语音对话模型主要针对主流语言进行优化,由于方言语音数据的稀缺,在资源匮乏的方言场景中仍然受到限制。此外,在方言适应过程中,语音对话模型的语义表示空间不断演化,而传统的语音监督保持不变,导致隐藏表示与语音目标之间的语义不一致,降低了语音的稳定性和自然性。为了解决这些问题,我们提出了 DialectS2S,一种针对中文方言的端到端语音对话模型。我们首先开发一个可扩展的方言语音对话合成管道,以实现高效的数据构建。我们进一步引入了具有自对齐语音监督的两阶段 后训练 策略,该策略将语音监督的语义内容与模型的进化语义表示对齐,以提高方言语音生成质量。实验结果表明,DialectS2S 在语音对话方面始终优于多种中文方言的现有基线,在方言一致性、响应质量和语音清晰度方面实现了实质性改进。我们的工作为资源匮乏的方言场景中的端到端语音对话建模提供了高效且可扩展的解决方案。为了方便未来的研究和实际应用,我们完全开源了 DialectS2S 框架,包括模型检查点、训练数据集和 微调 代码。