论文
超越初始化损失:LLM 词汇扩展的词元嵌入初始化策略的系统研究
Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension
摘要
词汇扩展是使预训练的 大语言模型 (LLM) 适应新语言的有效方法,但新添加的标记嵌入的初始化会强烈影响持续的 预训练 (CPT) 效率。我们对 Nemotron-3-Nano-30B-A3B 中印地语词汇扩展的 20 多种初始化策略进行了系统研究。我们的比较跨越词汇平均基线;外部和学习的初始化方法,包括 FOCUS、top-k 语义检索和残差 MLP 映射;子词组成;标准校准;以及投入产出不对称。我们发现子词组合方法优于词汇平均和外部/学习初始化方法。在子词组合中,不对称变体实现了观察到的最低早期验证损失,并揭示了输入和输出嵌入初始化的不同偏好。观察到的最佳配置使用统一子字平均和印地语特定范数校准来初始化输入嵌入矩阵,并使用字符长度加权子字平均来初始化输出语言建模头。相对于标准的 Mean-all 基线,这个完整的初始化管道达到了可比较的验证损失,CPT 步骤减少了 6 倍以上,并且仅在 500 步后就超过了基线的 3,500 步 MILU-Hindi 精度。最后,我们表明初始化损失和初始化每字节位数 (Init BPB) 是下游收敛的不可靠预测因子,而轻量级 CPT(只有 50 个步骤)为选择最佳初始化策略提供了经济有效且可靠的信号。