论文
任务向量什么时候会干扰?映射权重空间组合的有效性边界
When Do Task Vectors Interfere? Mapping the Validity Boundaries of Weight-Space Composition
摘要
任务算法通过添加重量位移来组合技能,然后在基准套件上对合并模型进行判断。我们测量该组合何时具有功能可加性,并发现答案不仅取决于模型的提示方式,还取决于合并的任务。在二维组合表面上——从 0.5B 到 8B 的五种模型设置,两个系列,LoRA 和完整的 微调——成对非可加性是真实的,种子稳定的,并且以粗序转移到看不见的任务对:所有八个预先注册的符号预测都被保留。但它在我们测量的任何地方都是输入条件的:在代码提示上显示六点交互对比度的相同合并模型在数学提示上没有显示任何内容,并且将相同的代码提示包装在适配器训练的指令模板中使对比度崩溃二十倍,从+6.9点到+0.3点——而在未经训练的聊天模板中重新序列化它们则保持完整(+12.5),从而伪造了我们自己预先注册的预测。执行基准(pass@1)继承了训练格式包装器的盲目性。因此,权重空间组合支持粗略的、输入和格式条件的函数语句——不是通用的合并性能预测器,也不是训练格式评估可以看到的。