论文

一种声音、多种语言:面向科学文本的跨语言声音克隆

One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

应用与实践内容创作

摘要

在以不同语言生成语音的同时保留说话者的语音身份仍然是口语技术中的一个基本挑战,特别是在科学传播等专业领域。在本文中,我们通过向国际口语翻译会议(IWSLT 2026)提交系统跨语言语音克隆共享任务来应对这一挑战。首先,我们评估了几种最先进的语音克隆模型,用于阿拉伯语、中文和法语科学文本的跨语言语音生成。然后,我们基于 OmniVoice 基础模型构建语音克隆系统。我们通过来自 ACL 60/60 语料库的多模型集成 蒸馏 使用数据增强。我们研究了使用合成数据进行微调的效果,证明了可懂度(WER 和 CER)和说话者相似度(SIM)的改进,并且不同语言的增益有所不同。