论文

LLM 微调 的目标条件监督学习

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

模型训练监督微调与指令调优

摘要

大语言模型 通常需要 微调 更好地使其行为与部署时的用户意图保持一致。现有方法通常分为在线和离线范例。在线方法(例如基于强化学习的对齐)可以直接优化结果质量,但通常依赖于外部奖励模型和迭代采样轨迹,这使得它们在许多情况下成本高昂且难以部署。离线方法更有效,但监督 微调 (SFT) 和直接偏好优化 (DPO) 等主流方法仍然有限:SFT 通常将分级反馈压缩为二元监督,而 DPO 依赖于通常不可用或构建成本昂贵的配对偏好数据。在本文中,我们提出目标条件监督学习(GCSL)作为 LLM 的离线 微调 框架。我们的核心思想是将反馈信号直接视为明确的目标,并纯粹通过监督学习来训练模型,以生成实现该目标的响应。为了更好地利用分级反馈,我们进一步引入了一种新颖的目标表述,将学习定义为持续追求高于目标质量阈值的结果,而不是模仿选定的高质量子集中的样本。这种设计通过学习满足或超过质量阈值的可转移模式来减轻有限学习效应。我们还提出自然语言目标表示,以进一步将这些模式与 LLM 的预训练知识和泛化能力联系起来。我们在三个任务上评估我们的方法:无毒生成、代码生成和 LLM 推荐。结果表明,我们的方法始终优于标准离线 微调 基线,同时保留监督学习的效率、可扩展性和简单数据要求。