论文
ARM:面向免训练泛化LLM代理合并的角色条件神经元移植
ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging
摘要
交互式大语言模型代理发展迅速,但大多数仍局限于单一环境,难以稳健地适应其他环境。模型合并提供了一种免训练的替代方案,可将多个专家整合进单个模型。本文提出Agent-Role Merging(ARM),一种面向LLM代理模型合并的激活引导、角色条件神经元移植方法。ARM将现有合并方法从静态自然语言任务改进到多轮代理场景,并提升跨多种交互环境的泛化能力。这通过一个精心设计的三步框架实现:1)构建合并骨干;2)基于角色条件激活分析进行选择;3)神经元移植以做细粒度精修。无需基于梯度的优化,ARM在提升跨基准泛化的同时保持了高效。在多样领域中,经ARM合并得到的模型超越既有模型合并方法与领域专属专家模型,并展现出较强的域外泛化能力。
