论文

CrossAccent-TTS:通过解开说话人和口音表示实现跨语言口音强度可控的文本转语音

CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations

应用与实践内容创作

摘要

口音转换和可控性仍然是跨语言文本转语音 (TTS) 的基本挑战,特别是对于资源匮乏且语音多样的印度语言。虽然最近基于 大语言模型 (LLM) 的 TTS 系统表现出强大的跨语言泛化能力,但它们对口音特征和强度的显式控制有限。在本文中,我们提出了 CrossAccentTTS,这是一个能够在保留说话者身份的同时实现口音控制和转换的框架。具体来说,我们引入了口音强度控制器(AIC),它将加权语言嵌入注入到口音子空间中,从而允许口音之间的平滑插值以及推理时口音强度的细粒度调制。在印度多语言和 L2-arctic 数据集上的实验表明,CrossAccent-TTS 实现了对口音强度的精确控制,通过保持说话者的相似性和自然度,在口音相似性和可控性方面优于强大的基线。