论文

没有任务向量是一座孤岛:基于策略蒸馏的任务向量可组合性的综合研究

No Task Vector Is an Island: A Comprehensive Study on the Composability of Task Vectors from On-Policy Distillation

模型优化模型合并

摘要

任务向量提供了一种通过模型合并来组合学习能力的简单机制。然而,通过策略蒸馏(OPD)产生的任务向量的可组合性在很大程度上仍未得到探索。 OPD 使用教师对学生生成的轨迹的反馈来训练学生,产生与教师模型生成的参数更新不同的参数更新,通常通过强化学习 (RL) 进行。因此,我们询问 OPD 任务向量是否可以补充其 RL 教师更新并有效地跨任务组合。在五个领域和两种模型架构中,我们找到了两种形式的可组合性的证据。在一个任务中,合并 OPD 和 RL 任务向量可以优于两个组成模型,即使 OPD 学生比 RL 老师弱。在各个任务中,OPD 任务向量组合在 8 个主干合并规则比较中的 7 个中比相应的 RL 组合获得了更高的平均分数。参数空间分析揭示了 OPD 和 RL 更新之间存在显着的非共线性。 SMOLLM3-3B 上的 CODE 域实验表明,在测试的全局更新范数下,组合方向优于任一组成方向,支持此配置中的方向互补性。在各个任务中,OPD 更新还显示出按更新能量排名的前 10% 前馈通道之间的重叠度较低。总之,这些结果表明,较弱的独立性能并不意味着较弱的任务向量可组合性。 OPD 任务向量可以补充更强大的 RL 教师更新,并有效地跨任务组合,突出可组合性作为理解和评估训练后更新的独特属性。