论文
从预言到嘈杂的语境:减轻言语中的语境暴露偏差-LLM
From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs
摘要
使用 Speech-LLM 的上下文自动语音识别 (ASR) 通常使用预言机对话历史记录进行训练,但依赖于推理时容易出错的历史记录,从而导致上下文通道中的训练测试不匹配,我们称之为上下文暴露偏差。我们提出了一个统一的训练框架来提高现实历史下的鲁棒性:(i) 通过使用 Whisper Large-v3 假设作为训练时间历史来获得教师错误知识,(ii) Context Dropout 来规范对历史的过度依赖,以及 (iii) 针对策划的失败案例的直接偏好优化 (DPO)。 TED-LIUM 3(域内)和零样本 LibriSpeech(域外)的实验显示了预测历史解码下一致的增益。以两个话语历史作为上下文,带有 Whisper 假设的 SFT 将 WER 从 5.59%(预言机历史训练)降低到 5.47%,DPO 进一步提高到 5.17%。在不相关上下文攻击下,DPO 产生的降级最小 (5.17% -> 5.63%),表明对误导性上下文的稳健性有所提高。我们的代码和模型发布在 https://github.com/XYGuo1996/Contextual_Speech_LLMs 上。