论文

InfoSFT:通过信息感知词元加权了解更多、忘记更少

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

模型训练监督微调与指令调优

摘要

受监督的 微调 (SFT) 提供了通过离线专家演示教授 LLM 新行为的标准方法。然而,标准 SFT 统一拟合所有样本——包括那些在基础模型下可能性较低的样本——这可能会不成比例地推动训练更新过度拟合特定样本,而不是学习目标行为。此外,适应这些不太可能的样本会导致重大的政策转变,从而降低先前的能力。现有方法通过过滤、重新生成或降低低似然数据的权重来缓解这一问题。这样做时,它们通常会精确地抑制基础模型尚未学习的新行为。我们提出了 InfoSFT,这是一种针对 SFT 目标的原则性加权方案,它将学习信号集中在信息量最大、中等置信度的标记上——这些标记既不太熟悉基本模型,也不太可能导致不稳定。 InfoSFT 只需要对标准 token-wise 损失进行一行修改,就可以明显提高普通 SFT 的泛化能力以及跨数学、代码和具有不同模型系列的思维链任务的似然加权基线,同时更好地保留预先存在的功能。