论文
Multi-DPO:推荐系统的多项直接偏好优化
Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems
摘要
直接偏好优化(DPO)是一种基于成对偏好的 大语言模型(LLM)简单有效的对齐策略。然而,在推荐系统中,用户反馈很少是成对的。对于给定的上下文,例如用户、会话或对话,我们通常会观察具有多个积极项目的集合偏好,其中每个积极项目的排名应高于每个未观察到的或明确消极的项目,而积极或消极本身之间没有规定的顺序。一个自然的概括是使用 Plackett-Luce (PL) 奖励模型,该模型将普通 DPO 基础的 Bradley-Terry 奖励模型从成对偏好扩展到候选人的完整排名。然而,我们表明,使 PL 模型适应集合偏好需要边缘化所有正序,其中生成的表达式在复杂性上是组合的。为了解决这一基本挑战,我们提出了 Mult-DPO,这是一种新颖的 DPO 目标,具有针对基于 LLM 的推荐系统的用户偏好对齐的按集合偏好事件的易于处理的多项代理似然。多项式构造本身并不是排名分布,但它是在相同的奖励引起的权重空间上定义的,并允许封闭形式的 DPO 式目标,从而能够通过分类式目标将 LLM 与多个候选者直接对齐。此外,我们证明,当针对集合偏好数据进行优化时,多项式 DPO 损失是边缘化 PL DPO 损失的一个易于处理的上限。我们进一步根据积极因素与消极因素的相对总权重来表征这一界限的紧密程度,这为用更丰富或更难的消极因素收紧界限提供了见解。最后,我们将 Mult-DPO 扩展到具有多个偏好级别的 LLM 的对齐。代码可在 https://github.com/yaochenzhu/Mult_DPO 获取