论文

注意停顿:使用 LLM 进行多语言语音校正的不流利感知客观调整

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

模型训练监督微调与指令调优

摘要

自动语音识别 (ASR) 文本通常包含不流畅的内容,例如填充、重复和错误开头,这会降低可读性并阻碍聊天机器人和语音助手等下游应用程序。如果不加以解决,这种不一致性会显着降低下游系统的可靠性。大多数现有方法都依赖于经典模型,这些模型专注于识别要删除的不流利标记。虽然这种策略在某种程度上是有效的,但它经常破坏语法结构和语义连贯性,导致句子不完整或不自然。最近的文献探索了 大语言模型 (LLM) 的使用;然而,这些努力主要集中在不流畅检测或数据增强上,而不是进行全面的纠正。我们提出了一种多语言校正管道,其中序列标记器首先标记不流利的标记,这些信号引导 LLM 的指令 微调 将转录本重写为流利的文本。为了进一步提高可靠性,我们添加了一个对比学习目标,该目标会惩罚不流利标记的复制,鼓励模型保留语法和含义,同时消除不流利的伪影。我们对三种印度语言(即印地语、孟加拉语和马拉地语)的实验表明,在强大的基线(包括多语言序列到序列模型)的基础上取得了一致的改进。这些结果凸显仅检测策略是不够的。将 词元级 提示与指令调整和对比学习相结合,为语音驱动的 NLP 系统中的多语言不流利纠正提供了实用且可扩展的解决方案。我们在 https://github.com/deepak-kumar-98/Mind-the-Pause 上公开提供这些代码。