论文

使用语义 ID 学习更好的生成推荐推理

Learning Better Reasoning for Generative Recommendation with Semantic IDs

模型训练强化学习

摘要

生成推荐将项目检索重新表述为序列生成,允许统一模型直接从用户的交互历史记录中生成下一个项目。语义 ID 通过将每个项目表示为离散代码,进一步使该范式变得有效和可扩展,从而实现语义相关项目之间的知识共享。最近的研究在语义 ID 生成之前引入了显式推理,帮助模型总结用户兴趣并推断可能的偏好转变。然而,推理本身并不是有益的:不准确或信息不足的推理可能会误导后续的项目生成,并最终降低推荐性能。这就提出了一个核心挑战:推荐器如何选择和学习有效的推理轨迹,并逐步进化到更好的推理?在这项工作中,我们提出了 Evo-Rec,这是一个三阶段框架,用于学习更好的推理并通过强化学习进一步增强推理。首先,我们将语义 ID 与其文本和行为上下文保持一致,使模型能够理解并生成项目标识符。其次,我们对多个候选推理轨迹进行采样,并保留那些改进真实项目预测的轨迹,通过监督微调提供更强的推理初始化。第三,我们通过目录约束项目生成和排名感知推荐反馈的强化学习进一步优化推理策略。对三个 Amazon Review 基准进行的实验表明,Evo-Rec 在所有评估指标中始终优于区分性、生成性和推理增强型推荐器。这些结果证明了我们的框架在学习基于 SID 的生成推荐的更好推理方面的有效性。