论文
SEAR:用于弱到强多语言语音 MCQ 的分段证据感知路由
SEAR: Segment-Evidence-Aware Routing for Weak-to-Strong Multilingual Speech MCQ
摘要
本文描述了我们用于第二届多语言会话语音模型 (MLC-SLM) 挑战赛任务 ~2 的系统。我们使用分段证据感知数据和 后训练 管道来调整 Qwen3-Omni-30B-A3B-Instruct。语言模型将带时间戳的 ASR 转换为连贯的事件跨度,该事件跨度按边界边缘扩展并从原始记录中裁剪。然后,我们使用 Qwen3.6-27B 合成互补语义 MCQ,使用 Gemini~3.1 Flash-Lite 合成声学 MCQ,然后进行结构、基础、答案一致性和目标模型可训练性检查,产生跨 21 种语言和口音变体的 359,825 个经过验证的 MCQ。纯文本探针将数据划分为弱的、可文本回答的项目,用于监督 微调 和强的、依赖于音频的项目,用于通过组序列策略优化 (GSPO) 进行强化学习,通过去偏优势、序列级重要性校正和动态过滤来稳定。我们的系统在最终的官方评估集上获得了 90.92% 的准确率。