论文

使用 TF-IDF 加权交叉熵损失重新平衡语言模型中的标记重要性

Rebalancing Token Importance in Language Models with TF-IDF Weighted Cross-Entropy Loss

模型训练监督微调与指令调优

摘要

大语言模型 通常在统一的标记权重下进行训练,这允许频繁且低信息的标记主导学习,并可以增加记住表面级别文本范围的倾向。为了解决这个问题,我们提出了一种信息加权交叉熵损失,它使用 TF-IDF 统计数据重新调整 词元级 贡献,强调语义信息标记,同时降低普遍存在的标记的权重。对五个仅解码器 LLM(参数范围从 1.1B 到 13B)的实验表明,记忆子串长度持续减少,同时保持困惑度和下游任务性能。在 LoRA 微调 下,TF-IDF 将所有五个模型的平均子串记忆长度减少了 14%。在 TinyLLaMA 1.1B 上的全权重 微调 下,减少量达到 58%。我们的方法与架构无关,可以以不到 3% 的计算开销合并到现有的训练管道中,提供一种轻量级且有原则的方法来减轻记忆,而不会破坏标准训练动态。