论文
STAR-GRPO:针对依赖于表示的奖励黑客的规范锚定和可靠性第一优势
STAR-GRPO: Canonical Anchoring and Reliability-First Advantages against Representation-Dependent Reward Hacking
摘要
当策略优化利用脆弱的奖励界面或过于宽松的代理目标时,奖励黑客就会发生,从而提高训练分数而不提高底层响应质量。这种现象在群体相关策略优化中被放大:不受支持的奖励可以改变群体基线并改变其他rollout的更新,而事后或纯粹相对权重不能代表群体范围内的不确定性。我们提出\emph{自调整锚定可靠性组相关策略优化}(STAR-GRPO),这是一种基于同一部署的配对评估的可靠性优先优势估计器。 STAR 将质量信号与其学习影响分开:分数不一致决定了rollout可靠性,相对可靠性在组标准化之前进入自调整的鲁棒位置-尺度拟合,而绝对组可靠性削弱了由此产生的有限优势。该分析建立了坐标和二阶矩边界,通过加权位置方程表征精确居中,并为外围奖励提供依赖于可靠性的衰减保证。我们在两种互补的奖励黑客机制中评估 STAR-GRPO。在词元接口开发中,STAR 可以防止已部署接口分数的失控优化,同时提高规范质量信号。在医学推理的标题代理过度优化中,STAR 改进了独立语义评估,缩小了代理-判断差异,并在优化相同任务代理的同时减少了过度声明。总之,这些结果表明,可靠性优先标准化提供了一种原则性的方法来限制不受支持的奖励对组基线和策略更新的影响,同时保留任务奖励作为优化目标。