论文

分散指令调整:冲突感知拆分和权重合并

Decentralized Instruction Tuning: Conflict-Aware Splitting and Weight Merging

模型训练监督微调与指令调优

摘要

指令调整使 大语言模型(包括多模态指令)与不同的用户意图保持一致,但异构混合的扩展受到梯度干扰和带宽繁重的同步的阻碍。我们询问是否可以通过独立训练混合物的各个部分并在参数空间中协调它们来共同解决这两个瓶颈。我们在共享平坦盆地内开发了一种局部二次理论,该理论产生了三个结果:权重合并产生曲率加权方差减少; PCA 对齐的冲突分裂最大化了沿高曲率方向的增益;合并还充当具有隐式范数正则化的谱过滤。这些结果直接激发了 MERIT,这是一种分散式合并就绪指令调整管道,可估计数据集级梯度冲突,沿顶部 PCA 冲突轴对混合物进行分区,独立微调每个分区,无需分区间通信,并通过词元加权平均合并一次。在具有 136 个 Vision-FLAN 任务的 Qwen2.5-VL-3B 上,MERIT 将 8 基准平均值从 54.3(联合训练)提高到 57.0。同样的方法可以在 160 万个示例、176 个源混合上扩展到 7B 模型——以最小的成本开销匹配或超过集中式联合训练——并传输到纯文本 FLAN。我们的代码可在 https://github.com/naver-ai/merit 获取。