论文

TLPO:词元级 缓解 大语言模型 中语言混乱的策略优化

TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models

模型训练强化学习

摘要

大语言模型 (LLM) 表现出强大的多语言能力,但往往无法一致地以目标语言生成响应,表现出一种称为语言混淆的现象。先前基于序列级 微调 的缓解方法(例如 DPO、ORPO 和 GRPO)在整个响应级别上运行,可能会导致一般模型功能意外退化,从而激发了对更细粒度替代方案的需求。为了解决这个问题,我们引入了 词元级 策略优化 (TLPO),这是一个 微调 框架,旨在通过本地化的 词元级 更新来缓解语言混乱。 TLPO 识别容易出错的位置,探索替代候选词元,并使用定制的目标更新策略,以在粒度级别抑制引发错误的输出。这种选择性干预可以有效缓解语言混乱,而不会影响模型的一般能力。对多种语言的多语言 LLM 进行的实验表明,TLPO 在提高语言一致性同时保持下游任务准确性方面显着优于基线。