论文
SFT冲突,RL共存:LLM多任务学习的理论与实证分析
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
摘要
有监督的 微调 (SFT) 和强化学习 (RL) 在增强 大语言模型 (LLM) 的多任务推理方面表现出根本不同的行为。我们的初步实验揭示了一个现象:SFT 在多阶段训练下会遇到严重的任务冲突,而 RL 可以实现不同任务之间的稳定共存。根据经验,我们将其追溯到参数级别,观察到 RL 会导致跨任务的稀疏且近似正交的更新。我们通过分析多任务梯度干扰,为这种机制提供了理论解释。我们的结果揭示了一个区别:SFT 中的干扰是范数限制的,与绝对梯度大小成比例,而 RL 中的干扰是方差限制的,受优势归一化和 同策略 优化引起的梯度方差限制。这种小方差界限在任务之间产生近乎正交的优化方向。利用这一见解,我们提出了并行强化学习,这是一种解耦多任务训练的范例,可显着提高效率和灵活性。