论文
DRIFT:解耦轨迹采样和重要性加权 微调 用于高效的多轮优化
DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization
摘要
大语言模型 越来越多地部署在多轮交互设置中,用户或环境可以迭代地提供轻量级反馈。不幸的是,优化这种行为在实践中遇到了一个尖锐的困境:在线强化学习能够有效地解决多轮动态问题,但由于每次更新时生成完全校正轨迹的成本而成本过高,而离线监督的 微调 (SFT) 虽然高效,但会遭受分布偏移和行为崩溃的困扰。为此,我们新颖地提出了 DRIFT(解耦轨迹采样和重要性加权 微调),这是一个框架,可操作化 KL 正则化 RL 目标相当于重要性加权监督学习的理论见解。 DRIFT 通过从固定参考策略中采样离线交互轨迹、导出基于回报的重要性权重,并通过对结果数据集进行加权 SFT 来优化策略,从而将轨迹采样与优化解耦。根据经验,我们证明 DRIFT 可以匹配或超过多轮强化学习基线的性能,同时保持标准监督 微调 的训练效率和简单性。代码可在 https://github.com/2020-qqtcg/DRIFT 获取。