论文
AgenticASR:通过智能体方法精化真实场景中的语音识别
AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
摘要
自动语音识别(ASR)在转写准确率上已取得长足进步,但逐字转写并不一定能直接产出可用的文本。它会保留填充词、重复、口误起头和自我修正,这些都会增加阅读负担、掩盖说话者的最终意图,并把未解决或被放弃的内容传递给下游任务。现有口语转书面语方法处理的是完整的音频或转写文本,当后续语音改变了前文应有的解读方式时,无法修订已输出的文本。因此,我们提出智能体语音识别(Agentic Speech Recognition,AgenticSR)任务:将音频转换为干净文本,在保留说话者最终意图的同时去除不流畅现象、消解自我修正并规范书面形式。AgenticASR 通过 ASR—Refiner 架构实现该任务:随着音频到来,反复变换有界的活动上下文并替换其对应的输出片段。这使得系统能够在任意时长的音频流上持续输出与修订。我们还提出 AASR-Bench,一个带细粒度原子评分规则的双语基准。在多个 ASR 前端上,AgenticASR 在被评测系统中取得最高的 AASR-Bench 分数。人机一致性研究表明,基于评分规则的判断与独立专家评估相一致。消融实验刻画了 Refiner 容量、上下文长度以及在线与离线推理之间的质量—延迟权衡。这些结果共同确立了 AgenticASR 作为在持续语音中进行保持意图的干净转写的实用框架。代码、AASR-Bench 与演示将发布于 https://github.com/AnXMuy/AgenticASR。
