论文
使用 LLM 进行用户偏好归纳,进行离线 Top-N 推荐评估
User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation
摘要
离线评估是比较 Top-N 推荐系统的标准方法,但它依赖于不完整的相关信息。在大多数基准数据集中,仅观察到用户项目偏好的一小部分,并且未经判断的项目通常被视为不相关。这种“缺失为负”的假设可能会使评估产生偏差,在没有记录反馈的情况下对看似合理的建议进行惩罚,并有利于专注于流行或高度曝光项目的算法。我们提出了一个基于 LLM 的框架来扩展离线推荐评估的相关性判断。我们的方法使用 大语言模型 发挥两个互补的作用。首先,偏好归纳阶段将每个用户的历史交互总结为捕获他们的品味和兴趣的文本配置文件。其次,根据此配置文件,LLM 充当原始测试数据中缺乏观察到的标签的候选推荐项目的相关性判断。为了使这个过程易于处理并且以评估为重点,我们将判断扩展应用于根据多个推荐器的顶级输出构建的合并候选集。由此产生的丰富判断为以前未观察到的用户-项目对提供了额外的相关性证据,从而能够在更完整的基础上计算排名指标。实验结果表明,该方法是一种很有前途的策略,可以提高离线 top-N 评估的鲁棒性,并减轻稀疏反馈引起的流行度敏感失真。