论文
口音类比指导:跨语言语音克隆中相同口音的说话者相似度更高
Accent Analogy Guidance: More Speaker Similarity at Equal Accent in Cross-Lingual Voice Cloning
摘要
在跨语言零样本文本转语音中,参考的口音会泄漏到目标语音中。我们提出了口音类比指导(AAG),这是一种免训练的采样器术语,它从模型对两种语言呈现的合成语音的预测中减去估计的口音方向,因此语音消失,只保留口音。通过对真实配音数据进行盲目的大语言模型口音判断,重新加权参考和文本及其变体之间的无分类器指导,保持在一条身份口音权衡曲线附近;我们根据该方法在等重音曲线上方的说话者相似度($\Delta$SIM)对方法进行评分。在四个开放 TTS 模型中,AAG 位于曲线上方:在 OmniVoice 上,$\Delta$SIM 在三个测试集上为 +0.11 至 +0.27(说话者相似度为 0.29,重音保持为 0.02,在 1-5 范围内重音为 3.51 至 4.28); MaskGCT 和 CosyVoice 2 也位于其曲线之上,并且在 F5-TTS 上它比任何重新加权设置都更加原生。免大语言模型语言 ID 测量和 12 名听众小组同意。前提测试和模型自身曲线的范围可以提前表明 AAG 是否可以获得增益以及大致可以获得多少增益,从而预测一个模型不会获得任何增益 (X-Voice)。