论文
GenRec:面向偏好的大规模推荐生成框架
GenRec: A Preference-Oriented Generative Framework for Large-Scale Recommendation
摘要
生成检索(GR)为通过下一个标记预测(NTP)进行推荐提供了一种有前途的范例。然而,将其扩展到大规模工业系统会带来三个挑战:(i)在单个请求内,由于分页请求机制,相同的模型输入可能会产生不一致的输出; (ii) 使用基于语义 ID 的多标记项目表示来编码长用户行为序列的成本高昂,以及 (iii) 将生成策略与细致入微的用户偏好信号保持一致。我们提出了 GenRec,这是一个部署在 JD App 上的面向偏好的生成框架,它在单一解码器架构中解决了上述挑战。对于训练目标,我们提出了 Page-wise NTP 任务,它监督整个交互页面,而不是单独监督每个交互项目,提供更密集的梯度信号并解决逐点训练的一对多模糊性。在预填充方面,非对称线性词元合并在保留全分辨率解码的同时压缩提示中的多词元语义 ID,将输入长度减少约 2 倍,并且精度损失可以忽略不计。为了进一步使输出与用户满意度保持一致,我们引入了 GRPO-SR,这是一种强化学习方法,它将组相对策略优化与 NLL 正则化相结合以实现训练稳定性,并采用混合奖励将密集奖励模型与相关门相结合来缓解 奖励作弊。在为期一个月的生产流量在线 A/B 测试中,GenRec 与现有管道相比,点击次数提高了 9.5%,交易次数提高了 8.7%。