论文
基于大语言模型的 ASR 的多模态对话环境:数据构建、训练和基准
Multimodal Conversational Context for LLM-Based ASR: Data Construction, Training, and Benchmark
摘要
对话上下文为自动语音识别 (ASR) 提供跨轮的语义和声学提示,但依赖历史记录可能会传播识别错误并丢弃发音和说话人信息。我们提出了一个基于 LLM 的 ASR 的多模态对话上下文框架,该框架集成了场景控制的数据管道、可扩展的多模态上下文训练和系统评估。我们围绕实体及其易混淆的形式构建对话,并将历史用户语音与辅助文本响应交织在一起,以进行监督微调。我们还引入了 MM-ContextASR Bench,它可以评估五个场景的上下文理解和实体错误纠正。 Qwen3-Omni 和 Step-Audio-2-mini 的实验揭示了处理不相关和错误历史记录的局限性,并表明我们的数据构建和训练提高了上下文利用率,多模态上下文在两个模型上实现了最高的整体实体召回率。对口音、方言和目标说话者 ASR 的进一步实验证明了历史语音的价值。基准数据和评估代码可在 https://github.com/llh666521/MM-ContextASR 上公开获取。