论文

超越排名准确性:评估 LLM 引用的特征理由以进行下一篮子回购建议

Beyond Ranking Accuracy: Evaluating LLM-Cited Feature Rationales for Next Basket Repurchase Recommendation

模型评测评测方法与指标

摘要

下一篮子回购推荐通常被制定为排名任务:根据客户的购买历史,系统对以前购买的可能再次需要的商品进行排名。然而,在生产环境中,排名准确性只是推荐质量的一个组成部分。客户还可以从有关为什么现在推荐某个商品的简明证据中受益。 大语言模型 (LLM) 提供了一种潜在的方法,通过基于可解释行为信号的基于特征、人类可读的原理来呈现此类证据。我们构建了涵盖节奏、频率、新近度、用户行为和商品受欢迎程度的回购特征,并在两个公共杂货数据集和一个专有零售数据集上评估 LLM。我们研究(1)现成的 LLM 是否可以使用这些特征作为相对于启发式和监督排名器的下一个篮子评分器,以及(2)LLM 引用的特征是否携带基于结果的排名信号。对于后者,我们在跨模型特征屏蔽协议下将 LLM 引用的特征与模型特定的归因方法进行比较,该协议在屏蔽所选特征后测量排名下降。我们的结果表明,LLM 分数与监督排名器相比没有竞争力,这表明现成的 LLM 不应用作独立的回购推荐器。然而,即使排名性能没有改善,提示和证据表示的变化也可以在某些情况下改善基于结果的特征掩盖结果;效果取决于数据集,并且与归因基线不一致。这些发现表明 LLM 作为经过验证的解释组件而不是主要排名者的实际作用,其基本原理质量与排名准确性分开评估。