论文
交互式 ASR:面向代理语音识别的类人交互和语义一致性评估
Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition
摘要
近年来,在模型架构和大规模训练数据的推动下,自动语音识别(ASR)取得了显着进展。然而,有两个重要方面仍未得到充分探索。首先,词错误率(WER)是几十年来占主导地位的评估指标,它对所有单词一视同仁,并且常常无法反映句子级别的话语语义正确性。其次,交互式纠正——人类交流的重要组成部分——在 ASR 研究中很少得到系统的研究。在本文中,我们将这两种观点整合到交互式 ASR 的代理框架下。我们建议利用 LLM-as-a-Judge 作为语义感知评估指标来评估 词元级 准确性之外的识别质量。此外,我们设计了一个 LLM 驱动的代理框架来模拟类人的多轮交互,从而通过语义反馈实现识别输出的迭代细化。在标准基准测试上进行了大量实验,包括 GigaSpeech(英语)、WenetSpeech(中文)、ASRU 2019 语码转换测试集。客观和主观评估都证明了所提出的框架在提高语义保真度和交互校正能力方面的有效性。我们将发布代码以促进交互式和代理 ASR 的未来研究。