论文
SoulX-Transcriber:用于多说话者语音转录的强大端到端框架
SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription
摘要
自动语音识别 (ASR) 和 大语言模型 (LLM) 的最新进展显着提高了语音理解能力。然而,多说话人语音转录仍然是一项具有挑战性的任务,受到高度相似的说话人声音、快速轮流转换、重叠话语和不准确的说话人边界分割的限制。这些挑战在现实世界的对话音频中变得尤为明显,其中说话人动态和声学条件变化很大。本技术报告介绍了 SoulX-Transcriber,这是一种统一的多说话人转录系统,可在基于 LLM 的框架内对说话人二值化 (SD) 和 ASR 进行联合建模。 SoulX-Transcriber 采用两阶段训练策略来提高说话人辨别力和转录稳健性。在第一阶段,说话人感知的多任务连续 预训练 增强了说话人表示学习和边界感知。在第二阶段,有监督的 微调 进一步优化了模型,以在复杂的多说话人条件下实现准确的端到端说话人归因转录。 SoulX-Transcriber 在 AliMeeting、AISHELL-4、AMI 等多个公共基准测试中提供强大的性能和稳健性,同时保持对多域场景的高度适应性。