论文

通过目标分布设计在监督 微调 上实现统一镜头

A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design

模型训练监督微调与指令调优

摘要

受监督的 微调 (SFT) 通常会最大化演示轨迹中每个标记的可能性。然而,观察到的标记可能是不唯一的、有噪声的或与先验模型不一致的。严格拟合这一单一热点目标可能不是最理想的,特别是当预训练模型编码了丰富的先验知识时。在这项工作中,我们将 SFT 重新解释为目标分布设计:我们不只研究损失目标,而是分析损失驱动模型匹配的 词元级 目标。我们引入了 Q-target 框架,它将 SFT 监督分解为两个明确的选择:(1)对观察到的 token 的依赖程度如何,以及(2)如何在替代方案上分配剩余的概率质量。这种观点将许多现有的 SFT 变体统一为目标分布 Q 的隐式选择。基于这种观点,我们提出了 Target-SFT,它直接从所需的目标分布构建训练目标。该方法在评估的十个推理数据集模型设置中始终表现出色,显示了这种基于目标的方法的有效性。总的来说,我们的公式揭示了 SFT 训练的更基本的设计原则,并为 SFT 目标开辟了更广阔的搜索空间。