论文
针对长文本-语音交错对话的本体记忆增强 ASR 校正
Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations
摘要
自动语音识别 (ASR) 纠正传统上侧重于孤立的话语或简短的本地上下文。然而,随着文本和语音在长时间交互中变得越来越交错,ASR 纠正需要对话级别的上下文证据。现有的 ASR 校正方法通常依赖于当前的假设或连接原始对话历史。在这种情况下,稀疏的纠正证据可能很难在冗余和噪音中找到。为了解决这些挑战,我们提出了一种用于长文本-语音交错对话的本体记忆增强 ASR 校正框架。该框架将先前的交互历史记录组织到动态可更新的本体存储器中,其中实体、术语、表面变体、潜在的 ASR 混淆和语义关系被存储为可检索的节点,以进行基于上下文的纠正。为了评估此设置,我们构建了 RAMC-Corr,这是一个从 MAGIC-RAMC 派生的数据集,用于使用有证据依据的上下文进行远程 ASR 校正。 RAMC-Corr 上的实验表明,我们的方法在 10 个配对主干设置组合中的 9 个中比直接纠正有所改进,并鼓励对上下文相关的 ASR 错误进行更有选择性和基于证据的纠正。