论文

NITP:LLM 预训练 的下一个隐式词元预测

NITP: Next Implicit Token Prediction for LLM Pre-training

模型训练预训练

摘要

标准下一个标记预测 (NTP) 仅通过输出 logits 空间中的离散标签来监督语言模型。我们认为,这种稀疏的单热监督使潜在表示空间受到限制,从而允许隐藏状态漂移到可以限制泛化的简并和各向异性配置。为了解决这个问题,我们提出了下一个隐式词元预测(NITP),它直接在表示空间中通过密集连续监督来增强离散预测。 NITP 使用同一模型的浅层表示作为稳定的自监督目标来训练模型来预测下一个标记的隐式语义内容。我们提供的理论分析表明,NITP 通过减轻自由度约束和鼓励紧凑的结构化表示几何来规范优化景观。根据经验,在参数范围从 0.5B 到 9B 的密集模型和 MoE 模型中,NITP 始终以可忽略的计算开销提高下游性能。在 9B MoE 模型上,NITP 在 MMLU-Pro 上实现了 5.7% 的绝对改进,在 C3 上实现了 6.4% 的增益,在 CommonsenseQA 上实现了 4.3% 的增益,并且训练 FLOP 增加了大约 2%,并且没有额外的推理成本。我们的实现可以在 https://github.com/aHapBean/NITP 上找到。