论文

你说的是我的语言吗?多模态中口语依从性 LLM

Are you speaking my languages? On spoken language adherence in multimodal LLMs

模型推理解码与生成控制

摘要

虽然基于 大语言模型 (LLM) 的自动语音识别 (ASR) 可实现无缝的多语言使用,但模型经常会错误识别输出语言,从而损害转录保真度和下游应用程序质量。为了保持灵活性和语码转换能力,我们提出了一种软提示方法,可以暗示潜在的口语,而不严格限制输出。我们将这一挑战正式定义为缺乏语言依从性,引入一种新颖的指标来量化违规行为,并评估三种缓解策略:(1)在不确定性下进行稳健指导的零样本提示,(2)监督微调(SFT)以提高提示依从性,以及(3)思想链(CoT)推理以在解码过程中强制遵守。我们对这些方法在多种语言上进行了比较分析,评估了在保持整体 ASR 性能的同时减少语言违规的有效性。最后,我们讨论在各种计算约束下指导策略选择的权衡。