论文
用说话人分离条件增强语音LLM对多说话人音频的理解
Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning
摘要
本文提出以说话人分离结果为条件的语音语言模型,将能力扩展到远场多说话人音频。与可能导致灾难性遗忘的序列化输出训练不同,方法用说话人分离掩码条件化声学编码器,提取目标说话人表示,同时冻结解码器。Dixtral将这种DiCoW编码器集成到Voxtral。在AMI、NOTSOFAR-1、LibriSpeechMix及Mixer6上,说话人归属转录的cpWER相对Gemini 3.0 Flash、VibeVoice及Voxtral Mini Transcribe V2分别绝对降低29.0、19.8和16.0个百分点。在新的长音频多说话人问答基准中,零样本Dixtral的远场内容理解达到Gemini水平;微调后,在所有任务上超过Gemini及处理近距离讲话音频的Voxtral。