论文
RoCo-ACE:面向留存感知知识注入的回放条件化在线蒸馏
RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection
摘要
知识注入为预训练多模态大语言模型(MLLM)补充新的事实性或领域特定知识,但拟合完整权威答案会引起未更新行为的漂移。在线蒸馏通过在模型生成的回放(rollout)上训练来缓解这一漂移,然而统一的以参考答案为条件的蒸馏提供的监督较为粗糙:它可能低估参考答案所支持的回放token的权重,并且只能间接监督被遗漏的事实。我们提出RoCo-ACE,一种面向知识注入的回放条件化在线蒸馏目标。RoCo利用同一回放内的无参考/有参考似然对比,将额外的蒸馏权重重新分配给参考答案所支持的回放token;ACE则为回放中遗漏的权威锚点添加稀疏的参考侧锚定修正,而无需模仿完整答案。在三种知识注入设置、六个留存基准、多个基线方法和多个基座模型上,RoCo-ACE在所比较的方法中取得最佳的注入知识准确率,同时使评估到的留存表现接近基座模型。
