论文

GRPO、GRPO 博士和 DAPO 是同一个数上的三种运算:群标准差恒等式

GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity

模型训练强化学习

摘要

训练语言模型进行推理的三种最流行的方法看起来像是三种不同的技巧。他们不是。所有这三个都调整一个数字:标准差,反映提示的采样答案的不一致程度。当训练这样的模型时,它会多次回答每个问题,并且自动检查器会标记每个答案的正确或错误。这些分数的标准差衡量的是分歧:当答案在正确和错误之间平均分配时最大,当答案全部一致时为零。组相对策略优化 (GRPO) 除以该数字,GRPO Done Right (GRPO 博士) 放弃除法,解耦剪辑和动态采样策略优化 (DAPO) 丢弃为零的组。每一种设置都有自己的解决方案,但本文证明它们是一个表盘的三种设置。这个表盘并不是装饰性的:对于正确或错误的奖励,分歧正是训练更新的大小,即群体标准差恒等式。分裂的小组教得最多,而一致的小组则什么也不教,并且保持沉默。同样的结果表明哪些问题最值得重视以及每个问题需要尝试多少次。本文证实了对大型真实难度数据集(Big-Math)和受控训练运行的直觉。看似无害的标准化步骤实际上是决定学习发生地点和强度的旋钮。