论文

用户模拟器引导的多轮偏好优化推理基于 LLM 的会话推荐

User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation

模型训练偏好优化

摘要

会话推荐系统(CRS)利用自然语言交互进行个性化推荐,但信息稀缺的对话历史和单轮推荐范例可能会严重阻碍复杂用户偏好的准确建模。为了缓解这个问题,最近的研究引入了基于 LLM 的用户模拟器,它可以生成自然语言反馈并执行模拟多轮交互以辅助推荐。然而,由于模拟器在推理过程中无法访问真实的用户偏好标签,因此它们的反馈可能会偏离实际的用户兴趣,导致错误在多次交互中累积,并严重影响推荐器的泛化。受 LLM 的多步推理能力和强化学习在策略优化中的有效性的启发,我们提出了 SMTPO,一种用户模拟器引导的多轮偏好优化会话推荐框架。为了在没有明确标签的情况下使模拟器生成的反馈与真实的用户偏好保持一致,我们通过多任务监督微调(SFT)来提高反馈质量,使模拟器能够更好地反映用户复杂多样的需求。为了解决偏差反馈破坏多轮优化稳定性的挑战,我们首先允许基于 LLM 的推理推荐器通过 SFT 学习偏好推理和推荐模式,然后采用强化学习和细粒度奖励设计来逐步与真实的用户偏好保持一致,从而提高推荐性能。对公共数据集的广泛实验证明了我们方法的有效性和可转移性。