论文

用于生成推荐的 LM 中新词汇的具有语义依据的词元初始化

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

模型训练参数高效训练

摘要

语言模型 (LM) 越来越多地通过用于特定领域任务的新的可学习词汇标记进行扩展,例如生成推荐中的语义 ID 标记。标准做法将这些新标记初始化为现有词汇嵌入的平均值,然后依靠受监督的 微调 来学习它们的表示。我们对该策略进行了系统分析:通过谱和几何诊断,我们表明均值初始化将所有新标记折叠到退化子空间中,消除了后续 微调 难以完全恢复的标记间区别。这些发现表明,当使用新词汇表扩展 LM 时,\emph{token初始化} 是一个关键瓶颈。受此诊断的启发,我们提出 \emph{具有语义依据的词元初始化假设}:在 微调 之前,在预训练的嵌入空间中在语言上扎根新颖词元,使模型能够更好地利用其针对新颖词元领域的通用知识。我们将此假设运作为 GTI(具有语义依据的词元初始化),这是一个轻量级的语义绑定阶段,在 微调 之前,仅使用配对语言监督将新词元映射到预训练嵌入空间中不同的、语义上有意义的位置。尽管很简单,但 GTI 在多个生成推荐基准(包括行业规模和公共数据集)的大多数评估设置中都优于均值初始化和现有的辅助任务适应方法。进一步的分析表明,扎根嵌入产生了更丰富的词元间结构,该结构在 微调 中持续存在,证实了初始化质量是词汇扩展中的关键瓶颈的假设。