论文
注意口音差距:语音驱动的金融语音助手中的英国口音稳健性
Mind the Accent Gap: British Accent Robustness in Speech-Driven Financial Voice Assistants
摘要
AI 语音助手通常使用自动语音识别 (ASR) 和基于LLM的推理,但现有系统难以应对英国地方口音,包括苏格兰、爱尔兰和威尔士口音,因为大多数 ASR 模型主要是根据美式英语语音数据进行训练的。因此,错误可能会持续到LLM阶段,破坏工具调用参数并产生错误或丢失的响应,这在财务方面代价尤其高昂。可部署的 ASR 还必须满足严格的延迟和记忆预算,这使得选择强健口音的模型变得更加困难。我们引入了 CavaBench,这是第一个内部收集的口语金融查询基准,并用它来评估一系列 ASR 模型及其在自我报告的英国口音中的端到端 ASR-LLM管道行为。我们发现 WER 强烈预测下游工具调用准确性 ($r = -0.93$),但可能无法反映任务级性能,与口音相关的故障在不同模型和声学条件下差异很大。这些发现指导了更具包容性、更可靠的语音财务助理的设计。