论文
第二届 MLC-SLM 挑战赛的领先沉默增强和多阶段综合监督
Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge
摘要
第二个多语言会话语音模型 (MLC-SLM) 挑战赛评估完整的、未分段的多语言会话中的两项任务:说话人分类和识别(任务 1)以及会话语音理解(任务 2)。这两个任务在评估时均不提供预言话语边界或说话者标签,并且任务 2 不提供问答训练集。对于任务 1,我们通过随机前导静音裁剪、一致的时间戳校正和指数移动平均 (EMA) 训练策略对 VibeVoice-ASR-7B 进行微调。对于任务 2,我们通过多模态候选生成、无声音频过滤和分布匹配增强构建合成问答对,并微调 Qwen3-Omni-30B-A3B-Instruct 以进行标记直接回答。在任务1评估集上,裁剪将tcpMER从18.30%降低到17.27%,EMA进一步将其降低到16.73%。在任务 2 评估集上,联合应用分布匹配增强和标记直接回答将准确率从 83.0% 提高到 86.0%。