论文

SRBench:使用 大语言模型 进行顺序推荐的综合基准

SRBench: A Comprehensive Benchmark for Sequential Recommendation with Large Language Models

模型评测基准与评测资源

摘要

LLM的开发引起了人们对顺序推荐(SR)应用的极大兴趣。然而,由于现有基准的局限性,对SR模型的综合评估仍然缺乏:1)过分强调准确性,忽视其他现实世界的需求(例如公平性); 2)现有数据集未能释放LLM的潜力,导致基于神经网络的SR(NN-SR)模型和基于LLM的SR(LLM-SR)模型之间的比较不公平; 3) 没有可靠的机制从非结构化 LLM 输出中提取特定于任务的答案。为了解决这些局限性,我们提出了SRBench,这是一个全面的SR基准测试,具有三个核心设计:1)涵盖准确性、公平性、稳定性和效率的多维度框架,符合实际需求; 2) 通过即时工程实现统一输入范式,以提高 LLM-SR 性能并实现模型之间的公平比较; 3)一种新颖的提示-提取器耦合提取机制,它通过提示强制输出格式和面向数字的提取器从 LLM 输出捕获答案。我们使用 SRBench 评估了 13 个主流模型,并发现了一些有意义的见解(例如,LLM-SR 模型过度关注商品受欢迎程度,但缺乏对商品质量的深入理解)。简而言之,SRBench 能够对 SR 模型进行公平、全面的评估,为未来的研究和实际应用奠定基础。