论文

语音 LLM 是上下文推理转录器

Speech LLMs are Contextual Reasoning Transcribers

模型推理推理策略与问题分解

摘要

尽管对语音输入进行了扩展,但在自动语音识别 (ASR) 中有效利用 大语言模型 (LLM) 的丰富知识和上下文理解仍然很重要,因为该任务主要涉及直接语音到文本的映射。为了解决这个问题,本文提出了思想链ASR(CoT-ASR),它构建了一个推理链,使LLM能够首先分析输入语音并生成上下文分析,从而充分发挥其生成能力。通过这种上下文推理,CoT-ASR 可以执行更明智的语音识别,并一次性完成推理和转录。此外,CoT-ASR 天然支持用户引导转录:在设计为自生成推理的同时,它还可以无缝合并用户提供的上下文来指导转录,进一步扩展 ASR 功能。为了减少模态差距,本文引入了 CTC 引导的模态适配器,它使用 CTC 非空白标记概率来加权 LLM 嵌入,有效地将语音编码器输出与 LLM 的文本潜在空间对齐。实验表明,与标准的基于 LLM 的 ASR 相比,CoT-ASR 的单词错误率(WER)相对降低了 8.7%,实体错误率(EER)相对降低了 16.9%。