论文

ReCast:在生成推荐中重铸强化学习的学习信号

ReCast: Recasting Learning Signals for Reinforcement Learning in Generative Recommendation

模型训练强化学习

摘要

基于通用组的 RL 假设采样的 rollout 组已经是可用的学习信号。我们表明,这种假设在稀疏命中生成推荐中被打破,其中许多样本组根本无法学习。我们提出了 ReCast,一种先修复后对比的学习信号框架,它首先恢复全零组的最小可学习性,然后用针对最强正值和最难负值的以边界为中心的对比更新来取代全组奖励归一化。 ReCast 保持外部 RL 框架不变,仅修改组内信号构造,并将轨迹采样搜索宽度与策略模型侧更新宽度部分解耦。在多个生成推荐任务中,ReCast 始终优于 OpenOneRec-RL,在 Pass@1 中实现了高达 36.6% 的相对改进。它的匹配预算优势要大得多:ReCast 仅用了轨迹采样预算的 4.1% 就达到了基准的目标性能,并且这种优势随着模型规模的扩大而扩大。相同的设计还产生了直接的系统级增益,将 Actor 端更新时间减少了 16.60 倍,将峰值分配内存降低了 16.5%,并将 Actor MFU 提高了 14.2%。机制分析表明,ReCast 缓解了持续存在的全零/单次命中制度,在自然积极因素稀缺时恢复可学习性,并将否则浪费的轨迹采样预算转化为更稳定的策略更新。这些结果表明,对于生成推荐,决定性的强化学习问题不仅是如何分配奖励,而且是如何从稀疏的结构化监督中构建可学习的优化事件。