论文
SimReg:通过嵌入相似性正则化在预训练中实现更高的性能
SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
摘要
使用下一个词元预测来预训练 大语言模型 (LLM) 已经取得了显着的进步,但此类模型中词元嵌入的上下文相关性质导致了较高的类内方差和类间相似性,从而阻碍了表示学习的效率。虽然基于相似性的正则化已在监督 微调 和分类任务中证明了其优势,但其在大规模 LLM 预训练中的应用和功效仍未得到充分探索。在这项工作中,我们提出了 SimReg,一种嵌入相似性正则化损失,它明确鼓励每个序列中具有相同 真值 标签的标记表示更加相似,同时通过对比损失强制与不同标签标记分离。我们的分析表明,该机制通过扩大多分类裕度带来收益,从而实现更有效的分类。跨密集和专家混合 (MoE) 架构的大量实验表明,SimReg 在标准基准测试中始终能够将训练收敛速度提高 30% 以上,并将平均零样本下游性能提高 1% 以上。进一步的消融研究和分析为超参数调整和损失有效性提供了实用的见解。