论文

ReDraft:以参考驱动修订实现持续多模态后训练

ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training

模型训练持续学习

摘要

大型多模态模型持续后训练应增加新能力并保留预训练能力,但两目标互相拉扯。SFT有明确监督,可让近零准确率任务被学会,离策略目标却可能使模型偏移并遗忘;RLVR和自蒸馏等同策略方法保持策略接近,却在模型不会任务时信号不足。我们提出参考驱动修订与微调ReDraft,从自身失败中兼得二者:专家回答仅作参考,模型修订自己的错误轨迹,验证器接受才保留并微调。因此目标既显式又接近当前策略。在Qwen2.5-VL-3B/7B的计数、读钟和拼图任务中,两项起始近零,ReDraft目标任务增56.9点,SFT增52.9点;旧任务损失从16.6降到1.5点,遗忘少11.3倍;也在两方面优于OPSD的19.3点增益和6.2点损失。数据与参数空间分析符合设计:修订目标在基础模型下概率更高,更新更紧凑,方向比OPSD更接近SFT。修复自身输出而非替换为专家输出,使同一目标兼顾学习与保留。

ReDraft:以参考驱动修订实现持续多模态后训练:论文配图
图1:在全部实验上取平均,比较目标任务收益与原任务损失。ReDraft位于左上区域。