论文

LLM 中的语义与协作协调:用于顺序推荐的基于推理的嵌入生成器

Harmonizing Semantic and Collaborative in LLMs: Reasoning-based Embedding Generator for Sequential Recommendation

模型训练强化学习

摘要

顺序推荐系统(SRS)根据用户的交互历史来预测下一个感兴趣的项目,并已被广泛部署,但受到长尾问题的阻碍。 大语言模型(LLM)具有强大的语义理解和推理能力,为丰富项目语义提供了一种有前途的方法,并且最近被用作嵌入生成器。然而,仍然存在两个根本性差距。首先,当前基于 LLM 的嵌入方法无法利用模型的内部推理能力。其次,现有方法通常通过监督 微调 隐式注入协作信号,缺乏协作嵌入对齐的明确指导。在本文中,我们介绍了 ReaEmb,这是一种新颖的框架,它通过潜在推理增强对比学习(LRCL)阶段和协作奖励强化学习(CRRL)阶段解决了这两个问题。 LRCL 通过带有附加注意模块的两遍前向过程来利用 LLM 的内部推理能力。 CRRL 随后通过定制的强化学习明确地将协作信号注入到 LLM 中。对三个真实世界数据集的广泛实验证明了 ReaEmb 在多个 SRS 模型中的卓越有效性。为了简化可重复性,我们在线发布代码。