论文
AlignDPO:用于减少纯解码器 TTS 中幻觉的偏好门控对齐
AlignDPO: Preference-Gated Alignment for Reducing Hallucination in Decoder-Only TTS
摘要
仅解码器的文本到语音 (TTS) 模型可以有效扩展,但仍然容易出现自回归生成过程中文本语音对齐较弱而产生的内容幻觉。我们发现鲁棒性是由与对齐的注意力头的锐度的非单调关系决定的:适度的程度是最好的,而过度锐化并不比未对齐的主干更好,甚至更不鲁棒。在此指导下,我们提出了AlignDPO,这是一种训练后方法,通过将轻量级联结时间分类(CTC)对齐项折叠到直接偏好优化(DPO)中来达到这种适度的状态,仅应用于所选样本,没有架构或推理时间变化。在 Seed-TTS-Eval 英语集上,相对于强大的 DPO 基线,这显着降低了内容幻觉率和单词错误率,并将严重内容幻觉率降低至约 0.6%(从 4.4%);听力研究进一步发现,它比主干线和基线更自然。因此,最好学习对齐并保持适度,而不是在解码时最大化或强加对齐。音频示例可从 https://align-dpo-demo.vercel.app 获取。