论文

LLM推荐重新排名的召回上限

The Recall Ceiling of LLM Recommendation Reranking

模型评测评测方法与指标

摘要

一些基于 LLM 的推荐重新排序器是在预言机协议下进行评估的,该协议保证真实项目存在于评分集中,通过将其注入候选列表或根据采样负数对其进行评分。在三个主要的 Amazon 数据集中,我们表明该协议高估了实际的 NDCG@10 92--95%。原因是召回上限:现实检索仅涵盖三个领域的八个数据集中 $K=100$ 的相关项目的 2--19%,这对任何封闭候选重排序器的 top-$k$ NDCG 施加了确定性上限。在留一评估下,$\mathbb{E}[\mathrm{NDCG}@k] \leq \mathrm{Recall}@|W_\pi|$,其中$W_\pi$是重排序器的候选窗口。在实际检索下,经过测试的优化策略均未显着优于我们主要亚马逊数据集上的协作过滤基线。这些策略包括提示工程、超过 168$\times$ 参数范围的模型缩放、顺序模型、监督神经重新排序、LoRA 微调、混合检索、分数感知提示和 LLM+CF 融合。文本感知检索增加了对一个数据集的召回率,但并没有改善端到端的 NDCG,而提供上游 CF 分数主要使 LLM 重现 CF 顺序。因此,我们提出了回忆感知评估协议(RAEP):首先对检索回忆机制进行分类,然后在上限允许有意义的区分的情况下评估重新排序。在这里测量的低召回率体系中,改进检索比提高重排复杂度更为重要;这种排序不需要在具有更高召回率、更丰富功能或在线反馈的生产系统中保持。