论文
DM-ASR:具有 大语言模型 的二值化感知多说话人 ASR
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
摘要
多说话人自动语音识别 (ASR) 旨在转录涉及多个说话人的对话语音,要求模型不仅捕获所说的内容,而且捕获谁说的,有时甚至捕获说话的时间。最近的 Speech-LLM 方法已显示出针对此任务进行统一建模的潜力,但联合学习说话者归因、时间结构和词汇识别仍然很困难且数据密集。在现阶段,利用可靠的说话者二值化作为显式结构先验提供了一种实用且有效的方法来简化这项任务。为了有效地利用这些先验,我们提出了 DM-ASR,这是一种二值化感知的多说话人 ASR 框架,它将任务重新表述为多轮对话生成过程。给定音频块和二值化结果,DM-ASR 将转录分解为一系列说话者和时间条件查询,每个查询对应一个时间段中的一个说话者。该公式将多说话人识别转换为一系列结构化子任务,明确地将说话人时间结构与语言内容解耦,并实现二值化线索与 大语言模型 推理能力的有效集成。我们进一步引入了一种可选的单词级时间戳预测机制,该机制将单词和时间戳标记交错,产生更丰富的结构化输出和更好的转录质量。我们的分析表明,二值化系统提供了更可靠的说话人身份和段级边界,而 LLM 擅长对语言内容和远程依赖性进行建模,展示了它们的互补优势。对普通话和英语基准的实验表明,所提出的方法利用相对较小的模型和训练数据实现了强大的性能,同时保持与现有统一方法的竞争力或优于现有的统一方法。