论文

迈向类人交互式语音识别:智能体式纠错与语义评估

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

应用与实践语音识别与转写

摘要

自动语音识别(Automatic Speech Recognition,ASR)是人机交互的核心组件,也是基于LLM的助手与智能体日益重要的前端。然而当前大多数ASR系统仍遵循单次范式,与人类交流方式——误解通过迭代澄清与修正来解决——相去甚远。这种错配使得关键语义错误一旦发生便难以纠正。同时,WER或CER等token级指标无法充分反映这一问题。为解决这些局限,我们将交互式ASR(Interactive ASR)表述为多轮修正任务,并提出Agentic ASR——一个将单次ASR前端与语义纠错、意图路由及基于推理的编辑相结合的闭环框架。我们进一步提出句子级语义错误率(Sentence-level Semantic Error Rate,S²ER)这一基于LLM的语义评估指标,并配套一个交互模拟系统(Interactive Simulation System),以实现可扩展、可复现的基准测试。在多语言、命名实体密集与语码转换基准上的实验表明,迭代交互持续减少语义错误,S²ER的改善幅度远大于常规token级指标。人机对齐与消融研究进一步验证了语义评判器的可靠性与所提框架的稳健性。代码发布于 https://interactiveasr.github.io/,在线演示见 https://i-asr.sjtuxlance.com/。

迈向类人交互式语音识别:智能体式纠错与语义评估:论文配图
图 1:日常人类交流、传统 ASR 范式和提出的 Agentic ASR 范式之间的比较。在自然对话中,误解可以通过多轮互动逐步纠正。相比之下,传统的 ASR 系统以一次性、开环的方式运行,识别错误(例如,将“Megan”与“Morgan”混淆)一旦产生就无法有效纠正。 Agentic ASR范式引入了一种包含用户反馈的闭环机制,能够迭代细化转录结果并更准确地理解。