论文
生成推荐中抗噪声 GRPO 的自适应损失平衡
Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation
摘要
强化学习(RL)提供了一种有前途的途径,可以超越监督模仿,利用奖励信号来指导政策改进,从而增强生成推荐。然而,其有效性很大程度上取决于其评估样本的奖励模型的可信度。在实践中,生产排名器(广泛采用的奖励模型)是根据暴露偏差日志进行训练的,导致与样本相关的不准确性违反了这一假设。我们的分层分析揭示了一个一致的模式:当政策表现出不确定性并且排名者可以有效区分 真值 项目和执行轨迹负面因素时,奖励指导是最有益的。在其他样本上,奖励信号要么可以忽略不计,要么是有害的,凸显了统一强化学习应用的风险。为了解决这个问题,我们引入了 AdaGRPO,这是一个新颖的框架,它将奖励引导的优化视为选择性接纳而不是统一压力。训练以有监督的负对数似然为基础,而 GRPO 目标则由二进制、每个样本的剪辑来控制,该剪辑由两个执行轨迹诊断确定:策略侧难度和奖励可辨别性。任一诊断失败的实例默认为纯监督,确保稳定性并减轻噪声梯度的放大。我们在大规模电子商务数据集上验证了 AdaGRPO。在最佳中间检查点,它将 HR@10 从 11.01% 提高到 12.18%,同时将幻觉限制在 0.22% 以下,并在最终检查点保持鲁棒性(HR@10 11.63%,幻觉 0.27%),在检索有效性边界上优于固定的 NLL-GRPO 混合物。在生产 A/B 测试中,AdaGRPO 在点击率和停留时间方面取得了统计上显着的收益,证实了其实用性。