论文
SAPO:基于推理的生成推荐的步骤对齐策略优化
SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation
摘要
生成推荐将下一个项目预测视为自回归项目标识符生成。具体来说,项目被编码为语义标识符(SID),它们是从粗到细的短词元序列,其早期词元捕获广泛的语义,而后来的词元对其进行细化。最近的工作通过推理轨迹增强了这一范式,并通过具有可验证奖励的强化学习对其进行优化,通常是对生成的 SID 进行精确匹配反馈的结果奖励算法。然而,在大目录推荐中,对生成的SID的精确匹配反馈仅报告最终项目是否正确;当生成的 SID 不匹配时,结果奖励无法识别哪个 SID 词元预测导致了不匹配,并且可能会惩罚匹配的 SID 词元位置以及不匹配的位置。我们发现,在此设置中贡献分配的自然单位是单个推理步骤(一个思维块与一个 SID 词元配对)。我们在 SAPO(步骤对齐策略优化)中实例化了这一想法:SAPO 不是将一个优势广播到整个响应,而是为每个推理步骤计算一个单独的组相对优势,并将其仅应用于相应的思维块和 SID 词元。在三个现实世界的推荐数据集中,SAPO 稳定了强化学习训练,并持续改进现有的生成推荐基线,在稀疏的精确匹配反馈使得推理步骤贡献分配变得重要时获得最大的收益。我们的结果表明,结构化生成的强化学习目标应该反映解码器自身对输出的分解。