论文

利用语音大模型实现带说话人标注的语音识别

Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS

应用与实践语音识别与转写

摘要

带说话人归属标记的自动语音识别 (SAA) 通过将相关说话人身份标签直接合并到转录内容中(例如,[说话人 1]:、[说话人 2]:),增强了传统 ASR 系统。在这项工作中,我们扩展了 Granite-speech 的功能,这是一种最先进的语音感知 大语言模型 (LLM),最初经过训练用于转录和翻译。我们证明它可以有效地适应 SAA,只需进行最小的架构更改。我们的核心贡献是引入说话人簇识别标签(例如,[说话者 1 集群 42]:),这些标签与 SAA 联合训练以显着提高准确性。为了解决训练数据的局限性,我们提出了一种使用人工连接的多说话人对话的数据增强方法。我们的方法在多个基准测试中进行了评估,与顺序执行说话人分离和 ASR 的传统管道相比,显示出了卓越的性能。