论文

弧线上的提示:Fisher-Rao 坐标中的高斯课程,用于高效rollout GRPO

Prompts Live on an Arc: Gaussian Curricula in Fisher--Rao Coordinates for Rollout-Efficient GRPO

模型训练强化学习

摘要

组相对策略优化(GRPO)仅从采样响应不一致的提示中学习:完全正确或完全错误的组的奖励方差为零,不贡献梯度,并且仍然消耗其rollout。提示选择方法通过将采样转向中间通过率来减少这种浪费,但它们会在原始通过率或 logit 坐标中启发式地选择目标、其宽度和不确定性模型。我们证明 GRPO 带有一个通过率的自然坐标:伯努利 Fisher-Rao 流形上的弧长 $ψ=\arcsin\sqrt{p}$。在弧长方面,预期的 GRPO 更新在两个边界斜坡内是一致的;零方差群的概率由宽度为 $1/\sqrt{2G}$ 的两个高斯边界层界定;通过率证据存在持续的噪音; pass@$k$ 和 pass$^k$ 目标的梯度是高斯分布,其中心和宽度以封闭形式遵循 $k$。因此,GRPO 的即时课程是弧长的高斯曲线,选择其中心就等于选择目标。我们将这一观察结果转化为 ARCUS,这是一个嵌入式采样器,它使用弧长的卡尔曼滤波器跟踪每个提示,通过目标匹配的高斯核乘以信息组的预测概率对提示进行评分,仅保留未更改的 GRPO 更新的信息组,并将目标调整到最难的目标,其预测产量与最佳目标保持在一小段差距之内。在六个数学推理基准和三个骨干网中,ARCUS 将 GRPO 的平均准确度提高了 2.8--2.9 个点,将动态采样的平均准确度提高了 1.1--1.2 个点,同时生成的 rollouts 比动态采样少了 48--57%。