论文
当模型合并对手联合多任务强化学习时:任务向量几何分析
When Model Merging Rivals Joint Multi-Task Reinforcement Learning: A Task-Vector Geometry Analysis
摘要
模型合并被推广为联合多任务训练的替代品,但在强化学习设置中,这种替代本质上从未根据其声称要替代的基线进行测试:方法精确地合并独立发布的代理,因为联合模型不可用。我们建立缺失的比较。使用 LOOP 在 AppWorld 代理基准上训练难度 1 和难度 2 Qwen3-8B 专家,我们将它们合并(TIES、RAM+),并将结果与相同数据上联合训练的模型进行比较。在完成任务目标时,合并与联合强化学习相匹配——并且每个合并变体在统计上是无法区分的。为了解释为什么合并方法在这里并不重要,我们测量了专家任务向量的几何形状,它不带有任务采样噪声:尽管有约 65% 的支持重叠,它们还是接近正交的(余弦 0.06 - 0.10),这是一个在训练过程中增长的小共享方向,并且我们根据随机初始下限和相同运行上限进行校准,以确认它反映了学习,而不是低秩参数化。因为方向和支持是解耦的,所以支持和基于符号的合并(RAM、TIES)崩溃到接近均匀的平均。我们发布所有代码和统计数据。