论文

从兴趣到语义 ID:用于生成推荐的基于检索的信用分配

From Interests to Semantic IDs: Retrieval-Grounded Credit Assignment for Generative Recommendation

模型训练强化学习

摘要

语义 ID (SID) 将每个目录项编码为短标记序列,使生成推荐器能够自回归预测下一个项目。推理增强变体是一种越来越常见的扩展,它首先生成文本跟踪,然后通过波束搜索解码下一项 SID。此类推荐器通常在精确匹配的 SID 奖励下通过与组相关的策略优化进行训练,这在大型目录中是稀疏的。以下是两种故障模式。当一个组中的所有部署都未达到目标时,该组的优势为零并且没有学习信号。共享相同 SID 奖励的部署获得相同的优势,无论其轨迹有何不同。在这两种情况下,奖励仅反映解码后的 SID,而不反映产生它的推理。这就造成了信用分配差距。我们通过基于检索的查询归因来解决这一差距。每个跟踪都被构造成一个历史摘要、一组兴趣假设和一个最终 SID。冻结检索器将每个假设作为目录查询来执行,以便每个假设都可以独立验证,而不是仅通过最终的 SID 来判断。当任何查询检索到 \mbox{top-$K$} 内的目标时,部署就会得到奖励,并且每个查询命中指示器将该奖励本地化到各个假设。因此,信用是在跨度级别分配的:只有单独命中的假设才会获得积极的检索优势,而检索通道永远不会更新最终的 SID 跨度。因此,共享 SID 奖励的部署可能会收到不同的更新。在三个亚马逊评论数据集上进行的实验中,这在 SID 推荐方面产生了一致的改进。在视频游戏中,预言机分析进一步揭示了兴趣条件 SID 解码的潜力:在生成的兴趣中选择与目标相关的查询可以提高召回率和排名。