论文

GISTBench:通过基于证据的兴趣核验评估LLM用户理解能力

GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification

模型评测基准与评测资源

摘要

我们提出 GISTBench,一个评估大语言模型(LLM)从推荐系统交互历史中理解用户之能力的基准。与聚焦物品预测准确率的传统推荐系统(RecSys)基准不同,我们的基准评估 LLM 从互动数据中抽取并核验用户兴趣的能力。我们提出两个新的指标族:兴趣扎根度(Interest Groundedness,IG),分解为精确率与召回率两个分量,分别惩罚虚构的兴趣类别并奖励覆盖面;以及兴趣特异性(Interest Specificity,IS),评估经过核验的 LLM 预测用户画像的独特性。我们发布了一个基于全球短视频平台真实用户互动构建的合成数据集。我们的数据集同时包含隐式与显式互动信号以及丰富的文本描述。我们以用户调查验证数据集的保真度,并评估了参数规模从 7B 到 120B 的八个开源权重 LLM。我们的发现揭示了当前 LLM 的性能瓶颈,尤其是它们在跨异构互动类型准确计数与归因互动信号方面的能力有限。

GISTBench:通过基于证据的兴趣核验评估LLM用户理解能力:论文配图
图 1:GISTBench 评估流程概述。用户交互历史由LLM处理以产生预测兴趣。这些在两个轴上进行评估:兴趣基础性(IG,分解为精确度和召回率)和兴趣特异性(IS,仅在经过验证的类别上计算),然后映射到标准化分类类别以进行标准化。