论文

提炼学生的去向:英语证据跨语言 RAG 的教师规范强化学习

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

模型训练强化学习

摘要

跨语言检索增强生成(RAG)通常部署在英语证据体系中,用户用多种语言进行查询,但检索到的段落仍然是英语。在这种情况下,尽管基础模型很强大,生成也可能会失败:英语证据会导致语言漂移(英语或语码转换输出),并且模型在生成非英语答案时使用的证据不可靠。我们将这些失败归因于两个 后训练 挑战:(i)错误与前缀相关,因此固定轨迹监督会遭受前缀不匹配的影响; (ii) 序列级(部分离散/基于判断)奖励会产生嘈杂的信用分配和高方差更新。我们提出 TR-RAG,一种教师正则化的 RL 配方,它将奖励优化与学生访问的前缀上的 同策略 蒸馏 结合起来。紧凑的学生对 同策略 答案进行采样,而更强的冻结教师仅在这些前缀上进行查询,并提供按前缀的学生到教师的反向 KL 锚点。我们进一步引入了英语证据多语言生成的奖励分解,结合了语言一致性、字符 3-gram 回忆和基于证据的正确性的 LLM 判断分数。通过三个基准(BioASQ-ENKB5、Hotpot-ENKB5 和自然多语言 MKQA)和两个骨干网,TR-RAG 在强基线上提高了语言依从性和基于证据的正确性的综合水平。至关重要的是,教师锚起到了安全网的作用:在域内语言上,它可以防止仅奖励强化学习可能因漂移到基本模型以下而遭受的语言一致性大幅崩溃(高达约 27 个百分点),而在遥远的分布外语言上,仅奖励强化学习在基本模型的上限处停滞,它仍然改善了证据基础;在 3 克字符记忆上,紧凑的学生有时会超过其 70B 的老师。