论文

免费保留项目语义:重新思考基于 LLM 的生成推荐中的词元初始化

Preserving Item Semantics for Free: Rethinking Token Initialization in LLM-Based Generative Recommendation

模型训练监督微调与指令调优

摘要

生成推荐 (GR) 的最新进展利用 大语言模型 (LLM) 作为推荐主干,使 LLM 能够直接生成以项目交互历史为条件的推荐。在这些系统中,项目通常通过作为特殊标记添加到 LLM 词汇表中的语义 ID (SID) 来表示。理想情况下,SID 为项目标记表示注入语义先验,从而提高模型泛化能力。然而,标准词汇扩展通常将这些标记初始化为随机高斯向量,丢弃 SID 的底层连续几何形状并强制 LLM 从交互数据中重新学习标记关系。为了演示这种设计的结果,我们首先表明从这种初始化开始的训练倾向于围绕项目流行度而不是语义来组织 SID 嵌入。我们进一步表明,尽管部分减少了对流行度的依赖并提高了冷项性能,但计算成本高昂的连续预训练(CPT)过程无法可靠地恢复原始语义几何。为了解决这些发现,我们提出了一种简单的、无参数的干预,直接从语义嵌入空间中相应的质心初始化 SID 词元嵌入。这种直接方法只需几行代码,无需额外的训练或推理开销,可将纯 SFT Recall@5 提高高达 16%,通过减少多达 40% 的 SFT 步骤达到峰值性能,并将冷项 Recall@5 提高高达 60%。此外,在受益于额外 CPT 的数据集上,质心初始化达到了相当的性能,同时需要一半的 CPT epoch。总之,我们的研究结果表明,除了共享前缀结构之外,保留 SID 几何形状为基于 LLM 的 GR 提供了简单而有效的语义先验。