论文

GEOALIGN:稳健 LLM 强化学习的几何采样轨迹管理

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

模型训练强化学习

摘要

在线强化学习广泛用于将 大语言模型 (LLM) 与奖励信号对齐,但在嘈杂或错误指定的奖励下,训练可能会不稳定。我们确定了一种称为方向不一致的故障模式:在一个批次内,一小部分高奖励的采样轨迹会导致表示空间偏好方向与大多数批次严重不一致,从而导致高方差和不稳定的更新。我们提出了 geoalign,这是一个轻量级插件,用于迭代策略优化中的采样轨迹管理。 Geoalign(i)形成提示内偏好对,(ii)学习每次采样轨迹隐藏状态的在线投影仪以集中奖励有序位移方向,以及(iii)通过与批量共识原型的角度偏差检测方向不一致的采样轨迹,并使用提示内稳定替代方案对其进行纠正。 Geoalign 仅是前向传递,增加的开销可以忽略不计。通过与学习的奖励模型的对话对齐和通过二进制验证奖励的数学推理,Geoalign 提高了最终性能并减少了训练振荡,优于 PF-PPO、PAR、PODS 和 Seed-GRPO。这些结果表明潜在的方向共识是在线 LLM RL 的有效可靠性信号。