论文
第二届 MLC-SLM 挑战赛的全语言 ASR 语音 LLM 系统
An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge
摘要
我们描述了我们提交给第二届 MLCSLM 挑战赛任务 1 的内容:一个级联二值化然后识别系统,结合了 DiariZen-Large-s80 (WavLM-Large) 分割、基于 CAM++ 嵌入的双说话人聚类和 LoRA 适应的omniASR LLM 7B v2 识别器,测试时没有预言分割或说话人标签时间。在官方开发集(150 个对话,21 种语言/口音类别)上,系统的宏观 tcpMER 为 29.27%,而官方基线为 79.15%;在评估集上得分为50.23%。我们还分析了两种对 tcpMER 产生重大影响的工程选择。首先,基于嵌入的说话人聚类优于仅从 ASR <sc> 转弯标记分配说话人的端到端样式替代方案。其次,重叠感知分割虽然旨在提高二值化召回率,但会增加 tcpMER,因为重叠的语音会被转录两次。