论文
基于熵-KL散度的token掩码:大语言模型选择性微调的新方法
Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models
摘要
监督微调(SFT)加强化学习(RL)已成为大语言模型的标准后训练范式。该范式为RL探索提供冷启动,避免了纯RL中策略内采样正样本不足的低效问题。然而在实践中,现有方法相比RL阶段往往只用少量数据进行SFT初始化,这会使模型拟合有限的样本并偏离其预训练分布。这种分布偏移阻碍了模型在后续RL训练中有效探索的能力。为应对这一挑战,我们提出在低数据量情形下,SFT应优先激活与任务相关的能力,而非记忆具体内容。沿着这一思路,我们提出EKSFT(Entropy-KL Selective Fine-Tuning),选择性掩码那些熵值高或相对参考模型KL散度高的token。通过不模仿这些高不确定性、造成分布偏移的token,EKSFT在注入任务特定知识的同时保持模型预训练分布的完整性。在数学推理基准上的实证评估表明,EKSFT始终优于标准SFT。从EKSFT模型出发的进一步RL微调也带来始终更好的RL后性能,表明RL阶段的探索得到改善。我们的代码与数据集发布于 https://github.com/MINE-USTC/EKSFT。
