论文

StreamProfileBench:现实流媒体场景中细粒度用户配置文件推断的基准

StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios

模型评测基准与评测资源

摘要

大语言模型(LLM)重塑了用户画像,但目前的评估主要集中在静态数据快照上。这种范式忽视了个性化系统的现实,即用户生成的内容 (UGC) 不断出现,细粒度的配置文件快速发展。为了弥补这一差距,我们引入了 StreamProfileBench,这是一个用于细粒度流媒体用户分析的大规模基准。我们将流式用户分析正式化为一项持续状态维护任务,并整理了一个高度真实的数据集,其中包含来自五个不同平台的 7,000 多个真实用户的 120,000 多个 UGC 帖子。通过利用用户兴趣的时间相关性,我们进一步提出了一种新颖的、无注释的评估框架。对 14 个领先的 LLM 进行的广泛实验表明,持续的配置文件更新仍然是一个开放的挑战。模型表现出系统性保守偏见,过度保留过去的利益而未能认识到利益衰减。消融实验进一步验证了流范式的实用性和必要性。数据和代码托管在 https://github.com/WaterWang-001/StreamProfileBench。