论文
迈向类人交互式语音识别:智能体式纠错与语义评估
Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation
摘要
自动语音识别(Automatic Speech Recognition,ASR)是人机交互的核心组件,也是基于LLM的助手与智能体日益重要的前端。然而当前大多数ASR系统仍遵循单次范式,与人类交流方式——误解通过迭代澄清与修正来解决——相去甚远。这种错配使得关键语义错误一旦发生便难以纠正。同时,WER或CER等token级指标无法充分反映这一问题。为解决这些局限,我们将交互式ASR(Interactive ASR)表述为多轮修正任务,并提出Agentic ASR——一个将单次ASR前端与语义纠错、意图路由及基于推理的编辑相结合的闭环框架。我们进一步提出句子级语义错误率(Sentence-level Semantic Error Rate,S²ER)这一基于LLM的语义评估指标,并配套一个交互模拟系统(Interactive Simulation System),以实现可扩展、可复现的基准测试。在多语言、命名实体密集与语码转换基准上的实验表明,迭代交互持续减少语义错误,S²ER的改善幅度远大于常规token级指标。人机对齐与消融研究进一步验证了语义评判器的可靠性与所提框架的稳健性。代码发布于 https://interactiveasr.github.io/,在线演示见 https://i-asr.sjtuxlance.com/。
