论文

HORIZON:野外用户行为建模的基准

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

模型评测基准与评测资源

摘要

现实世界中的用户行为是多样化的、跨领域的、跨越很长的时间范围的。然而,现有的用户建模基准仍然狭窄,主要关注单个域内的短会话和下一项预测。这些限制阻碍了稳健且可推广的用户模型的进展。我们提出了 HORIZON,一个新的基准,它沿着三个轴(即数据集、任务和评估)重新制定用户建模。 HORIZON 基于亚马逊评论的大规模跨域重构而构建,涵盖 5400 万用户和 3500 万个商品,支持异构环境中的模型预训练和实际评估。与之前的基准不同,它挑战模型跨领域、用户和时间进行泛化,超越同一领域中的标准缺失阳性预测。我们提出了新的任务和评估设置,可以更好地反映现实世界的部署场景。其中包括时间泛化、序列长度变化和对看不见的用户进行建模,其指标旨在评估一般用户行为理解而不是孤立的下一项预测。我们对流行的顺序推荐架构以及利用长期交互历史的基于 LLM 的基线进行基准测试。我们的结果凸显了当前方法与现实世界用户建模需求之间的差距,同时将 HORIZON 建立为时间稳健、跨域和通用用户模型研究的基础。