论文

要求确定:信息交互带来自信的多回合 LLM 建议

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

模型训练偏好优化

摘要

大语言模型 (LLM) 的最新进展使其能够用作会话推荐系统 (CRS),展示出强大的推荐准确性和自然对话。然而,引导多轮交互以有效地引发用户偏好仍然具有挑战性。现有方法要么使用具有模板化交互的单独强化学习代理,要么针对另一个 LLM 判断的交互性进行优化,而不测量实际获得了多少有用信息。我们提出了一种新方法,通过减少助手的不确定性(通过推荐熵来衡量)来量化每次交互的有效性。我们应用这种熵减少作为奖励,而不依赖于 真值 建议(这在现实场景中通常不可用)来微调 LLM,从而实现战略交互生成。 INSPIRED 和 ReDial 数据集上的监督 微调 (SFT) 和直接偏好优化 (DPO) 的实证结果表明,我们的方法提高了推荐质量和对话效率。