论文

HINTT:多语会话转录的级联与统一方案比较

HINTT Submission to the 2nd MLC-SLM Challenge: Comparing Cascaded and Unified Approaches to Diarization and ASR

应用与实践语音识别与转写

摘要

本文介绍了提交给第二届多语言会话语音模型(MLC-SLM)挑战和研讨会的 HINTT 系统。我们解决多语言说话者归因的 ASR,其中系统必须确定谁在何时说话以及说什么内容。我们研究了针对此问题的两种建模策略:将说话人二值化与基于语音 LLM 的 ASR 相结合的级联管道,以及直接生成说话人标签、时间戳和转录的统一语音 LLM。我们的最终提交基于级联管道,由微调的 DiariZen 二值化模型、微调的 Qwen3-ASR 模型和基于 LLM 的生成错误校正组成。为了进行比较,我们也将微调 VibeVoice-ASR作为统一模型使用相同的官方训练数据。所有特定任务的微调和模型选择均仅使用官方 MLC-SLM 数据进行,无需外部数据或伪标签。实验结果表明,级联系统在 MLC-SLM 任务 1 条件下仍然更加可靠,而统一语音 LLM 为未来说话人归因的 ASR 提供​​了一个有希望的方向。