论文

TokenMinds:在大型推荐系统中用于用户理解的预训练用户词元和嵌入

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

应用与实践行业应用

摘要

工业推荐系统中的用户建模通常会产生密集的嵌入,这受到固定维向量固有的表示约束。离散用户表示的新兴替代方案——使用 LLM 生成基于文本的用户标记——捕获主题共现而不是深层顺序行为动态,并产生难以根据项目属性进行处理的输出。与此同时,基于语义 ID (SID) 的项目标记化已被证明可以有效提高生成推荐的泛化能力,但基于 SID 的离散用户表示在很大程度上仍未得到探索。我们提出了 TokenMinds,这是一个工业规模的系统,它将 PLUM 框架从项目检索扩展到用户建模,通过改编自预训练 LLM 的编码器-解码器架构生成离散的基于 SID 的用户词元和密集的用户嵌入。这种双输出设计提供了离散的、基于语义的用户表示的互补优势,同时保持了与依赖密集嵌入的现有下游模型的兼容性。此外,共享 SID 词汇自然地扩展到跨场景建模:通过将长格式和短格式视频行为统一到单个模型中,我们大大降低了训练和服务成本。我们通过广泛的离线实验和在多个 YouTube 平台上的实时发布来验证 TokenMinds,并通过异步基础设施为完整的用户流量(数十亿用户)提供服务,该基础设施将表示生成与下游评分分离。重点关注排名作为主要下游用例,我们的结果证实了基于 SID 的用户词元在工业规模上的实际可行性,并证明词元和密集嵌入在不同的生产排名系统中提供了互补价值。