论文
基于扩散的 ASR 解码策略:基于置信度的阈值的系统评估
Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding
摘要
虽然基于 LLM 的自动语音识别 (ASR) 实现了高精度,但其速度受到顺序自回归解码的限制。扩散语言模型 (DLM) 提供了一种并行替代方案,但其解码策略在 ASR 环境中仍未得到充分探索。本文分析了基于DLM的ASR的三种解码方案:固定数量、静态置信度阈值和动态置信度阈值。我们使用基于负对数似然的不确定性作为预测可靠性的代理,引入了解码进度的循环分析。我们的结果表明,两种基于阈值的策略都比固定数量方案提供了更好的准确性和速度权衡。此行为与在评估的 ASR 设置中观察到的更集中的置信度分布相关:许多词元较早达到高置信度,从而能够在早期解码轮次中提交多个词元,而置信度较低的词元则推迟到后面的轮次。静态阈值策略以较低的解码成本实现了接近自回归解码的精度。