论文

通过强化学习检索增强会话推荐

Retrieval Augmented Conversational Recommendation with Reinforcement Learning

上下文与知识检索增强

摘要

大语言模型 (LLM) 在语言理解和生成方面表现出增强的能力。通过利用其嵌入式知识,LLM 越来越多地用作会话推荐系统 (CRS),从而在不同场景中实现更高的性能。然而,现有的基于 LLM 的方法依赖于预训练的知识,而没有针对新项目的外部检索机制。此外,缺乏统一的语料库给将检索增强集成到 CRS 中带来了挑战。受这些挑战的推动,我们提出了 RAR,这是一种新颖的两阶段检索增强会话推荐框架,它可以协调检索和生成,以提高性能和真实性。为了支持这个框架并提供统一的语料库,我们构建了一个大规模的电影语料库,其中包含超过 30 万部具有丰富元数据的电影,例如标题、演员表和情节摘要。利用这些数据,我们的主要贡献是 RAR,这是第一个通过动态桥接检索和生成来脱离标准两阶段 CRS 的框架。首先,检索器模型根据用户历史生成候选项目;在后续阶段,LLM 通过将对话上下文与检索结果相结合来完善推荐。此外,我们引入了一种新颖的强化学习(RL)方法,该方法利用 LLM 反馈来迭代更新 检索器。通过创建一个协作反馈循环,用更高的排名指标来强化采样的候选集,RAR 有效地减轻了检索和生成阶段之间的不一致。此外,将 LLM 以事实元数据为基础,使我们的强化学习驱动方法能够捕捉微妙的用户意图,并生成上下文感知的建议,同时减少幻觉。我们通过对多个基准进行大量实验来验证我们的方法,其中 RAR 始终优于最先进的基线方法。