论文
GCPO:在 LLM 的 Rollout RL 中诊断和约束子空间几何
GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs
摘要
同策略 轨迹采样方法(例如 GRPO)是 大语言模型 的 后训练 的核心,但它们经常遭受训练不稳定、跨任务能力下降和响应长度膨胀的问题。尽管先前的工作已经描述了聚合更新的子空间几何形状,但该几何形状的逐步变化及其与模型性能的关系仍不清楚。我们引入了主子空间重叠,这是相对于预训练权重的主要奇异子空间的个体轨迹采样更新的维度校正度量。尽管平均重叠率较低,但瞬态峰值通常会先于性能下降。为了解决这个问题,我们提出了 GCPO(几何约束策略优化),它应用硬双边正交投影来约束对互补子空间的更新,从而通过构造来防止此类偏移。在 Qwen3-8B 和 GLM4-9B 上的数学推理、代码生成和工具使用任务中,GCPO 始终优于 GRPO 和最新变体(包括 DAPO 和 GSPO),比基本模型和最强基线分别提高了 27.69 点和 2.37 点。此外,GCPO 保留了一般能力,消除了响应长度膨胀,并稳定了政策熵。我们的研究结果为稳定强化学习 后训练 提供了新的诊断镜头和原则性设计视角。