论文

用于减轻基于 LM 的文本转语音中的幻觉的经验校准对比解码

Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

模型推理解码与生成控制

摘要

基于语言模型的文本转语音(基于 LM 的 TTS)仍然容易受到偏离目标文本的语音幻觉的影响。现有的缓解措施主要依赖于架构变化或额外的训练,而解码时间控制仍未得到充分探索。我们提出了一种条件信息视图,它将文本派生的对齐信息与声学上下文和学习的语音规律提供的经验信息区分开来。我们假设,当在脆弱的过渡中所选词元中未充分反映对齐支持时,就会出现一类重要的幻觉。使用来自具有和不具有文本条件的相同语音 LM 的预测,我们提出了体验校准对比解码 (ECCD),这是一种 无需训练 方法,可增强对齐支持,同时保留有用的体验信息。 ECCD保留了原始的专家分布,仅应用正对齐增强,并使用集合级经验兼容性来校准其强度。在四种模型中,ECCD 在所有 SeedTTS-Eval 设置和 25 种多语言 CV3-Eval 设置中的 24 种中将 WER/CER 降低了高达 55.6%。听力测试产生了 0.644的 CMOS 增益,同时保留了很强的说话人相似性。进一步的分析表明,对齐影响和决策级别增益在语言单元内有所不同,并且在首次错误边界处低于匹配正确边界处。总体而言,这些广泛的实验和分析将条件信息控制确定为减轻言语幻觉的有前途的解码时间方向。