论文

克服先前的障碍:长尾分布下的监督微调

Overcoming Prior Barriers: Supervised Fine-Tuning under Long-Tail Distribution

模型训练监督微调与指令调优合成数据

摘要

有监督微调 (SFT) 使预训练的大型语言模型 (LLM) 适应下游任务,但所需的概念可以获得截然不同级别的预训练支持。频繁出现的概念更有可能被很好地学习,而罕见的概念可能仍然表现不佳。我们引入了一个名为先验障碍的新概念来量化预训练模型对目标概念的竞争概念的支持程度。我们观察到先验障碍遵循长尾分布,将头部和尾部概念置于 SFT 的不同起点:头部概念面临较低的先验障碍,而尾部概念需要额外的指令来克服其较高的先验障碍。我们的理论分析进一步推导了长尾先验障碍下 SFT 的预测风险界限,明确描述了先验障碍和累积的 SFT 证据如何共同决定预测性能。受这种先前的障碍相关需求的推动,我们提出了 PASS,一种自适应 SFT 指令选择方法,它构建了参考派生的概念和 估计每条指令提供的区别证据,并自适应地将选择预算分配给当前选择中仍未充分涵盖的概念。这样,PASS在有限的预算下共同考虑哪些指令可以提供有用的证据,哪些地方需要额外的监督。实验表明,我们的方法在四种骨干预算设置上始终优于七种最先进的指令选择方法。消融研究进一步表明,PASS 的自适应分配比统一分配持续改进。