论文

用于低资源目标语言生成的基于源的语义强化学习

Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation

模型训练强化学习

摘要

低资源目标语言生成通常受到稀缺并行数据的限制,而高资源源语言单语言数据丰富但难以与标准监督 微调 一起使用。我们提出了基于源的语义强化学习(SG-SRL),这是一种资源利用框架,可将源语言单语数据转换为跨语言语义监督以生成目标语言。 SG-SRL 使用跨语言语义奖励模型对源语言数据执行无参考强化学习 (RL),该模型由跨语言重新排序器实例化,对源输入和目标语言生成之间的语义相关性进行评分。虽然这会导致严重的基于冗长的 奖励作弊,但使用小型并行语料库的轻量级恢复阶段可以恢复流畅性、简洁性和任务格式,同时保留语义增益。中泰生成实验表明,SG-SRL 比冷启动 SFT 提高了语义基础和事实覆盖率。对长格式传输和基于藏语嵌入的奖励的额外分析阐明了 SG-SRL 的泛化行为,并表明基于编码器的语义奖励可以在现实的低资源语言环境中替代基于 LLM 的重排序器。