论文
用于数据高效的代码转换 ASR 的强化学习
Reinforcement Learning for Data-Efficient Code-Switched ASR
摘要
音频语言模型可以提示进行代码转换语音,但它们的解码并未针对代码转换进行优化,并且经常在语言边界处失败。我们提出了一种实用的强化学习,具有可验证的奖励配方,使用组相对策略优化,将音频语言模型数据高效地适应代码转换的 ASR,将错误率奖励与惩罚错误书写系统的脚本保真度奖励相结合,并采用两遍草稿和细化程序。使用 Qwen2-Audio 作为跨 10 个语言对的可重复测试平台,仅对 TTS 代码转换语音进行训练,我们表明 10% 的数据的 RLVR 与在完整数据集上训练的 LoRA 监督的 微调 相匹配,在类型上距离较远的语言对上获得最大收益。错误率奖励消除了翻译错误,而脚本保真度奖励则单独减少了脚本污染而不降低质量。这些增益将零样本转移到人类记录的语码转换语料库中。