论文
具有语义奖励的强化学习可实现低资源语言扩展,无需对齐税
Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax
摘要
将 大语言模型 (LLM) 扩展到资源匮乏的语言通常会产生“对齐税”:目标语言的改进是以通用功能的灾难性遗忘为代价的。我们认为这种权衡源于监督 微调 (SFT) 的刚性,它强制对狭窄且有偏差的数据分布进行 词元级 表面模仿。为了解决这个限制,我们提出了一种由组相对策略优化(GRPO)支持的语义空间对齐范例,其中使用嵌入级语义奖励而不是似然最大化来优化模型。这一目标鼓励通过灵活的实现来保存意义,从而实现受控更新,从而减少对预先训练的知识的破坏性干扰。我们评估了我们在藏汉机器翻译和藏文标题生成方面的方法。实验表明,我们的方法获得了低资源能力,同时显着减轻了对齐税,比 SFT 更有效地保留了一般能力。尽管产生的刚性表面重叠较少,语义强化学习在开放式生成中产生了更高的语义质量和偏好,并且少量迁移结果表明它在有限的监督下学习了更多可迁移和鲁棒的表示。总体而言,我们的研究表明,具有语义奖励的强化学习为包容性低资源语言扩展提供了更安全、更可靠的途径。