论文

DoTS:先解耦训练,再在推理时融合 SFT 与 RLVR 任务向量

Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

模型优化模型合并

摘要

SFT 与 RLVR 是互补的 LLM 后训练范式,分别侧重知识广度和推理深度,但顺序训练可能造成灾难性遗忘,联合优化则可能出现严重梯度冲突。论文通过任务向量分析发现幅度差异、符号干扰和模块更新分布不一致三项结构性质,说明直接融合困难,但两类训练也修改了部分互补组件。DoTS 让 SFT 与 RLVR 检查点独立训练,仅在推理时通过任务向量运算组合能力,不更新模型参数。为减少干扰,方法进行选择性稀疏化并保持范数缩放,再用少量无标签查询上的贝叶斯优化,在一致性和困惑度的帕累托前沿搜索组合系数。多项数学推理基准中,方法达到或超过基于训练的 SFT—RLVR 融合方法,计算成本约为其3%。用于更强后训练检查点时,方法超过现有领先模型,并无需重新调参即可推广到域外基准。代码已公开。