论文

推理增强推荐的强化偏好优化

Reinforced Preference Optimization for Reasoning-Augmented Recommendations

模型训练强化学习

摘要

推荐系统对于跨数字平台提供个性化内容至关重要,大语言模型 (LLM) 的最新进展提供了新的机会,可以通过更丰富的世界知识和明确的推理能力来增强推荐系统。借助推理知识,推荐可以更好地推断用户的潜在意图,适应不断变化的偏好,并利用语义关系来提高准确性和可解释性。然而,由于集成过程中的结构破坏以及将自由形式生成转换为准确的项目预测的困难,现有的基于推理的推荐方法通常无法将 LLM 的推理过程与特定于推荐的目标完全一致。在本文中,我们介绍了 RPORec,这是一种增强型偏好优化框架,它将 LLM 主干的推理能力与专用推荐头 (Rechead) 相结合,以实现精确的项目检索。 RPORec 包括两个阶段:(1)推理增强推荐建模,生成高质量的思想链(CoT)推理并用作辅助知识来指导 Rechead 学习特定于推荐的表示; (2) 高级推理细化和对齐,其中训练有素的 Rechead 产生可验证的奖励,通过强化学习微调 LLM 主干,提高推理质量、结构一致性和任务相关性。对公共基准和大规模在线部署的大量实验表明,RPORec 始终优于最先进的基于 LLM 的推荐方法,证明了推理增强推荐建模在现实系统中的有效性。