论文

ARM:面向免训练泛化LLM代理合并的角色条件神经元移植

ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging

模型优化模型合并

摘要

交互式大语言模型代理发展迅速,但大多数仍局限于单一环境,难以稳健地适应其他环境。模型合并提供了一种免训练的替代方案,可将多个专家整合进单个模型。本文提出Agent-Role Merging(ARM),一种面向LLM代理模型合并的激活引导、角色条件神经元移植方法。ARM将现有合并方法从静态自然语言任务改进到多轮代理场景,并提升跨多种交互环境的泛化能力。这通过一个精心设计的三步框架实现:1)构建合并骨干;2)基于角色条件激活分析进行选择;3)神经元移植以做细粒度精修。无需基于梯度的优化,ARM在提升跨基准泛化的同时保持了高效。在多样领域中,经ARM合并得到的模型超越既有模型合并方法与领域专属专家模型,并展现出较强的域外泛化能力。

ARM:面向免训练泛化LLM代理合并的角色条件神经元移植
图2:Agent-Role Merging(ARM)总览。步骤1:骨干池构建。我们对面向基准特化的专家应用多种免训练的权重空间合并算子,得到候选合并骨干池。步骤2:骨干选择。选择器在轻量级校准集上利用角色条件化的 MLP 激活计算 Activation-Overlap Score(AOS),并选择使跨基准平均 AOS 最大的候选骨干。步骤3:神经元移植。对于所选骨干仍然薄弱的基准,我们将少量 top- k % k\% 的供体(专家)MLP 神经元移植到骨干中,同时严格保护对其他基准显著重要的神经元,以避免负迁移。最终得到的单一模型无需端到端重训练即可整合跨基准的专家能力。