论文

音频中英汉语码转换语音识别的直接偏好优化 LLM

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

模型训练偏好优化

摘要

尽管具有强大的多语言功能,但音频 大语言模型(音频 LLM)在转录语码转换语音方面表现出系统性故障。针对英语-普通话,我们确定了三种失败模式:语言遗漏、翻译代替转录和幻觉。我们应用直接偏好优化(DPO)来调整模型,构建偏好对,其中所选响应保留混合语言内容,而被拒绝的响应模仿失败模式。在 10 万对(570 小时)上训练三个音频 LLM,我们观察到一致的行为变化:模型学会保留语言构成,而不是在提示转录时进行翻译。这种调整使 MER 降低高达 89.6%(分布内)和 20.0%(分布外)。我们的研究结果表明,DPO 可以有效地从多语言音频 LLM 中引出正确的代码转换转录行为。