论文

超越静态 Best-of-N:基于 LLM 推荐的贝叶斯列表对齐

Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation

模型训练偏好优化

摘要

大语言模型 利用其生成功能对复杂的用户偏好进行建模,彻底改变了推荐系统 (LLM4Rec)。然而,现有的 LLM4Rec 方法主要依赖于 词元级 目标,这使得优化定义实际推荐质量的列表级和不可微分指标(例如 NDCG、公平性)变得困难。虽然 Best-of-N (BoN) 在推理过程中直接优化这些指标,但其高计算成本阻碍了实际部署。为了解决这个问题,BoN Alignment 旨在将搜索能力提炼到模型本身中,但目前的方法存在两个关键局限性:(1)无差别监督,静态参考无法区分超出其经验范围的候选者的相对质量,导致排名指导的丧失; (2)梯度衰减,随着不断发展的政策的改进,有效的监管信号迅速减弱,导致优化效率低下。为了克服这些挑战,我们提出了 BLADE(通过动态估计进行贝叶斯列表对齐)。与静态方法不同,BLADE 引入了贝叶斯框架,该框架通过融合历史先验与模型当前采样轨迹的动态证据来不断更新目标分布。这种机制构建了一个自我进化的目标,适应模型不断增长的能力,确保训练信号在整个学习过程中保持信息丰富。对三个真实世界数据集的大量实验表明,BLADE 的性能显着优于最先进的基线。至关重要的是,它打破了静态性能上限,在排名准确性(召回率、NDCG)和复杂的列表指标(公平性、多样性)方面实现了持续增长。该代码可通过 https://github.com/RegionCh/BLADE 获取。