论文

RLHF 中的分布鲁棒词元优化

Distributionally Robust Token Optimization in RLHF

模型训练强化学习

摘要

大语言模型 (LLM) 倾向于正确响应与他们接受训练和微调的数据非常一致的提示。然而,措辞、格式或语言的微小变化可能会引发令人惊讶的巨大失败,尤其是在多步骤推理问题上。为了解决这个问题,我们提出了一种分布式鲁棒词元优化(DRTO)方法,它将 词元级 人类反馈强化学习(RLHF)与分布式鲁棒优化(DRO)相结合。 DRTO 在跨度级别的参与者损失上构造 f 散度模糊集,提供了一种在策略优化期间强调困难响应部分的原则方法。根据经验,DRTO 增强了不同任务之间多个推理基准的分布变化下的一致性,与标准 RTO 相比,在 MATH-500 上实现了 $+4.4$ 个百分点,在 LiveCodeBench 上实现了 $+2.7$ 个百分点。