论文

回归基础:语音智能体时代重新审视ASR

Back to Basics: Revisiting ASR in the Age of Voice Agents

模型评测基准与评测资源

摘要

自动语音识别(ASR)系统在精选基准上已达到接近人类的准确率,但在当前评估未系统覆盖的条件下,仍会在真实语音智能体中失败。缺乏能隔离特定失败因素的诊断工具,从业者便无法预判在哪些条件下、哪些语言中会造成何种程度的性能退化。我们提出WildASR,一个完全源自真实人声的多语言(四种语言)诊断基准,沿环境退化、人群偏移和语言多样性三个轴分解ASR鲁棒性。通过评估七个广泛使用的ASR系统,我们发现严重且不均衡的性能退化,且模型鲁棒性不能跨语言或跨条件迁移。关键的是,模型在部分或退化输入下常常幻觉出听起来合理却并未说出的内容,给下游智能体行为带来具体的安全风险。我们的结果表明,有针对性的、因素隔离的评估对理解和改进生产系统中ASR的可靠性至关重要。除基准本身外,我们还提供了三个可供从业者用于指导部署决策的分析工具。

回归基础:语音智能体时代重新审视ASR:论文配图
图 1:WildASR 中现实世界分布变化下的多语言 ASR 稳健性。我们评估了四种语言的七个 ASR 系统,并在三个 OOD 维度上汇总了性能。水平线表示分布内干净集模型平均参考 (5.7%),定义为所有模型和语言的 FLEURS 测试集上的平均错误率。 OOD 条件下的急剧且不均匀的退化表明,分布内数据的人类同等性能无法可靠地转移到现实世界的环境中。