论文

联合学习全局-本地说话人分类以增强端到端说话人分类和识别

Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition

模型训练监督微调与指令调优

摘要

大型音频语言模型(LALM)在端到端说话人分类和识别方面表现出了卓越的性能。然而,由于大规模对话数据的稀缺以及缺乏明确的说话人表示优化,它们的说话人辨别能力仍然有限。为了解决这个问题,我们提出了 GLSC-SDR,这是一种通过二值化和识别联合训练说话人分类的范例。我们进一步引入了全局-本地说话人分类策略,该策略使用集群说话人作为全局标签,并将重新编码的集群内说话人作为本地标签。这种分层设计增强了细粒度的说话人辨别能力,同时保持了语义转录的准确性。 AliMeeting、AISHELL-4 和 AMI-SDM 上的实验表明,与基于模拟的多编码器方法相比,GLSC-SDR 无需依赖大规模真实对话数据即可实现具有竞争力或优越的性能。