论文

GR2技术报告

GR2 Technical Report

模型训练强化学习

摘要

工业推荐系统通过多阶段漏斗(检索、早期排名和重新排名)为数十亿用户提供服务,其中最终的重新排名步骤不成比例地影响用户参与度和下游性能,特别是对于轮播和网格显示格式。尽管人们对推荐中的 大语言模型 (LLM) 的热情日益高涨,但三个差距阻碍了行业采用:(1) 大多数工作都以检索和排名为目标,而重新排名(最接近最终用户体验的阶段)在很大程度上尚未得到充分探索; (2) LLM 通常是零样本部署或通过监督 微调 部署,未充分利用强化学习 (RL) 在可验证奖励上解锁的推理能力; (3) 部署的目录使用位于任何基本 LLM 词汇表之外的非语义标识符来索引数十亿个项目。我们提出了 GR2(生成推理重排序器),这是一种端到端框架,它结合了(i)由具有 >=99% 唯一性的分词器生成的语义 ID 的中期训练,(ii)通过有针对性的提示和拒绝采样从更强大的教师那里提取的推理轨迹,以及(iii)带有专为重新排序而构建的可验证奖励的强化学习。为了使 GR2 资源可行,我们进一步 (iv) 引入了一种上下文压缩器,可以分摊训练成本,同策略 蒸馏 (OPD) 作为 SFT 的可扩展替代方案(我们发现 SFT 在工业规模上崩溃),并推理 蒸馏 以实现低延迟服务。 GR2 在工业规模流量的传统基准上提供 +18.7% R@1、+7.1% R@3 和 +9.6% N@3。我们进一步发现,奖励设计对于重新排名至关重要:LLM 经常通过保留传入订单或利用位置偏差来破解奖励,从而激励有条件的可验证奖励作为重要的工业组件。