论文

学习调整 SFT 数据以实现更好的推理泛化

Learning to Adapt SFT Data for Better Reasoning Generalization

模型训练合成数据

摘要

大语言模型(LLM)取得了显着的进步,其中后训练在增强他们的推理能力方面发挥了至关重要的作用。在后训练范式中,有监督的微调(SFT)被广泛使用:它利用外部数据提供密集的监督并实现高效的训练。然而,当数据分布与目标模型自身的分布不匹配时,直接对专家数据进行 微调 可能会损害泛化能力。在这项工作中,我们提出了推理调整的数据适应(DART),它将使用固定的、可能分布不对齐的 SFT 数据集作为演示转换的优化问题。 DART 通过强化学习训练映射器模型,将原始 SFT 数据转换为模型自适应监督,​​更好地匹配目标模型的分布和学习偏好。然后将转换后的数据用于 SFT,使目标模型能够更好地利用外部监督。跨多个模型和数据集的实验表明,DART 提高了泛化能力,实现了比直接 RL 更高的训练效率,并帮助模型超越了标准 SFT。我们的代码可在 https://anonymous.4open.science/r/DART525E50D 获取。