论文
双形式 ASR:用于中文语音识别的语义感知逆文本规范化
Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition
摘要
现代自动语音识别 (ASR) 场景既需要忠实转录的口语形式转录,也需要具有逆文本规范化 (ITN) 的可读书面形式转录。然而,这些形式通常是由级联模块生成的,其中口头形式的 ASR 输出由单独的 ITN 组件重写,使得书面形式的 ASR-ITN 容易出现识别错误,并使规范化与声学上下文建模脱钩,特别是对于语义相关的数字表达式。在本文中,我们提出了双形式 ASR (DF-ASR),这是一个框架,通过配对的口语形式和书面形式监督,将口语形式 ASR 功能扩展到语义感知的书面形式 ITN,同时保留转录形式之间的提示级别选择。双形式监督是通过 大语言模型 (LLM) 驱动的生成和判断工作流程构建的,并且通过 ITN-MWER 进一步增强了训练,ITN-MWER 是一种序列级目标,可为归一化敏感跨度上的错误分配更高的成本。我们还引入了决策感知 REQUIRE-ITN/\FORBID-ITN 协议来单独测量所需的标准化和禁止跨度保留。在来自 SpeechIO 的手动注释中文子集上,DF-ASR 始终优于开源 ASR-ITN 系统,与强大的闭源参考保持竞争力,并在口语形式和书面形式输出之间保留可靠的提示级别控制。