论文

CTC 甲骨文差距的剖析:声学耗竭和语言恢复

The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery

应用与实践语音识别与转写

摘要

我们研究了 CTC 内部评分对于 N 最佳假设选择的限制,并找到了将声学置信度与语言合理性分开的信息瓶颈。与 LibriSpeech dev-other 上 G=16 的贪婪解码相比,11 个 CTC 内部和声学特征评分策略没有产生统计上显着的 WER 改进(所有 p > 0.05)。这种耗尽是系统性的:CTC 的假设得分与每个话语 WER 之间的 Spearman $ρ$ 从 G=4 时的 -0.574 降级到 G=128 时的 -0.270,由空白路径扩散导致 53% 的损失。这表明 CTC 内部表示的判别能力已经饱和:声学信号的重组无法弥补预言机的差距。确认瓶颈是语言而非声学,通过 MBR 解码引入的外部语言信息突破了这一瓶颈。使用 RoBERTa 伪对数似然 (PLL) 后验 ($τ$=10,G=128) 进行 MBR-CER 解码,在其他 LibriSpeech 测试中实现 5.42% WER(贪婪 5.96%,$Δ$=-0.535 pp,p<0.0001,相对 9.0%)。 RoBERTa PLL $ρ$ 在相同范围内仅降低 21%,在 CTC 失去的情况下保留了辨别能力。该配方无需在两个 Zipformer 架构、三个域(LibriSpeech、TED-LIUM 3、VoxPopuli)和四个 MUSAN 噪声级别进行重新调整即可应用,在 13 种条件中的 11 种中获得显着收益。在训练方面,通过 CTC 前向-后向算法进行的标准 MWE 训练在输出投影处实现 Rao-Blackwellized REINFORCE(方差比 Viterbi 低约 3 倍)。然而,序列级 微调 在接近收敛的检查点处失败:CR-CTC 上的所有四个 MWER 配置都崩溃了(+6.18 到 +8.90 pp WER),因为 0.007 pp 的训练预言机间隙没有提供可用的奖励信号。