论文
从“弱”信号到强模型:基于LoRA合并的偏好差值聚合
From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging
摘要
训练强的大语言模型(LLM)需要高质量监督,而高质量监督往往稀缺。近期工作表明,来自弱-更弱模型对(例如Qwen3 4B对1.7B)的成对偏好数据,尽管单个回答质量有限,却能通过相对质量差值提供有效的监督信号,我们将其称为“弱”信号。由此引出一个关键研究问题:多个“弱”信号能否被建设性地聚合起来以改进强模型(例如Qwen3 8B)?为此,我们提出偏好差值聚合(PDA),首个从每个弱-更弱模型对推导偏好差值、将其实例化为通过偏好优化学习的LoRA适配器、并通过LoRA合并聚合所得差值的框架。为进一步缓解LoRA合并过程中的方向性干扰,我们提出几何对齐合并(GAM),一种在聚合前对齐适配器子空间的几何感知合并方法,可实现更稳健的多样化差值组合。在知识推理与智能体搜索基准上的评估显示,聚合多个“弱”信号可将性能推向超越任何单一信号的水平,且随着纳入更多信号还会进一步提升。相应地,结合GAM的PDA使强模型在知识推理与智能体搜索上平均分别提升6.8分和7.3分。它优于所有单差值与多差值基线,超出最佳单差值基线2.1分和4.3分。进一步分析将这些增益归因于不同偏好差值所编码的互补能力的有效组合。
