论文
通过 ASR 自验证和 蒸馏 实现可靠的神经编解码器文本转语音:跨模型和编解码器的灾难性故障近乎为零
Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs
摘要
开放式自回归神经编解码器文本转语音 (TTS) 模型在典型输入上听起来非常出色,但会遭受随机灾难性故障:在有意义的部分话语中,它们会发出沉默、提前终止或崩溃为重复或幻觉内容。我们证明这种故障模式的消除成本很低。在单一格式稳健指标(通过 ASR 往返的灾难性故障率)下,N 最佳 ASR 自我验证将故障率降至接近于零:在标准语料库 (LibriSpeech) 上 N=2,在硬提示集上 N=4,没有观察到的故障。这不是一个模型的产物:这种减少在四个开放编解码器-TTS 系统和三个神经编解码器(XCodec2、SNAC、Mimi)中复制,在四个中的三个上以 N=2 达到接近零的下限。然后,我们通过将自我验证的行为提炼到模型中,在推理时免费修复,这恢复了单次解码中的大部分鲁棒性,在没有测试时间成本的情况下关闭了硬输入上约 52-58% 的故障质量。 蒸馏 增益集中在需要的地方(硬输入);在已经可靠的散文中,没有空间,也没有可察觉的变化。受控比较增加了一个明显的负面影响:离线直接偏好优化(DPO/IPO)无法击败普通监督的 蒸馏,在线迭代变体很有希望,但在我们的评估规模下无法在统计上分离。我们诚实地报告了一种可以抵抗的模型(更大的 Llasa,其规模并没有明显的帮助)和一个没有自我 蒸馏 方法能够克服的罕见词能力上限