论文
回归基础:语音智能体时代重新审视ASR
Back to Basics: Revisiting ASR in the Age of Voice Agents
摘要
自动语音识别(ASR)系统在精选基准上已达到接近人类的准确率,但在当前评估未系统覆盖的条件下,仍会在真实语音智能体中失败。缺乏能隔离特定失败因素的诊断工具,从业者便无法预判在哪些条件下、哪些语言中会造成何种程度的性能退化。我们提出WildASR,一个完全源自真实人声的多语言(四种语言)诊断基准,沿环境退化、人群偏移和语言多样性三个轴分解ASR鲁棒性。通过评估七个广泛使用的ASR系统,我们发现严重且不均衡的性能退化,且模型鲁棒性不能跨语言或跨条件迁移。关键的是,模型在部分或退化输入下常常幻觉出听起来合理却并未说出的内容,给下游智能体行为带来具体的安全风险。我们的结果表明,有针对性的、因素隔离的评估对理解和改进生产系统中ASR的可靠性至关重要。除基准本身外,我们还提供了三个可供从业者用于指导部署决策的分析工具。
