论文

评估大型语言模型推荐中的品牌检索和排名

Evaluating Brand Retrieval and Ranking in Large Language Model Recommendations

模型评测评测方法与指标

摘要

大型语言模型 (LLM) 越来越多地用于产品推荐,但评估其推荐提出了与传统信息检索和推荐系统不同的挑战。大语言模型无需明确的候选集即可生成推荐,并且对同一查询的重复响应可能会产生不同的品牌和排名。我们引入了一个评估开放式大语言模型品牌推荐的框架,该框架定义了独立于模型输出的竞争集,并通过重复抽样估计推荐的流行度和突出程度。我们使用品牌推荐概率 (BRP@$k$) 和平均倒数排名 (MRR@$k$) 来操作这些构造,并将该框架应用于五个产品类别的六个大语言模型。仅类别查询揭示了已建立品牌的大量遗漏以及有限的证据表明推荐显着性遵循传统品牌受欢迎程度。相反,知名度与更广泛的市场可见度信号相关,特别是搜索兴趣和在线品牌对话。基于需求的查询表明,将用户的目标和约束置于上下文中会改变检索到的品牌,而诊断定位探测表明,当提供独特的线索时,从普通推荐中省略的品牌仍然可以有条件地检索。这些发现强调需要将 LLM 推荐作为随机检索和排名过程来评估,而不是根据单独生成的列表来评估。我们提供开源软件和数据来支持对大语言模型生成的品牌推荐进行可重复的评估。