论文

DiaScriber:联合多说话人分离与转录的语音大模型

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

应用与实践语音识别与转写

摘要

多说话人自动语音识别(MSASR)旨在联合预测内容转录、说话人身份和时间戳,从而解决“谁在何时说什么”的关键问题,在现实世界的多说话人场景中具有巨大的实用价值。然而,MSASR 在快速话轮交替、重叠语音以及复杂多样的多说话人场景下仍然遇到相当大的挑战。在这项工作中,我们提出了 DiaScriber,一种基于语音 大语言模型 构建的端到端多说话人分离和转录模型。我们首先构建不同的数据管道,以涵盖各种多说话者场景及其复杂性,包括验证和细化、话轮交替和重叠语音模拟以及多模态注释。此外,DiaScriber是基于Qwen3.5-Omni的预训练版本,通过持续预训练、有监督的微调和强化学习的三阶段训练策略开发的。实验表明,DiaScriber 在广泛的多说话人场景测试集上实现了优于比较方法的性能,并在未见过的多说话人场景中表现出了出色的泛化能力。