论文

BACAM:用于多轮交互的行为感知持续智能体合并

BACAM: Behavior-Aware Continual Agent Merging for Multi-Turn Interaction

模型优化模型合并

摘要

模型合并提供了一种集成专业专家能力的方法,但现有的智能体合并方法通常需要所有专家同时可用。我们研究连续的智能体合并,它按顺序集成传入的专家,而不保留以前合并的专家。然而,参数空间或特征子空间中的合并并不能确保合并模型获取新专家在交互轨迹上的行为。此外,对新专家的更新可能会破坏合并模型之前集成的交互行为。因此,我们提出了行为感知连续智能体合并(BACAM),它使用专家引导的行为监督从候选生成的轨迹中学习参数明智的合并门。任务级稳定性可塑性控制和张量级冲突感知更新预算限制了对现有功能的干扰,同时允许获取新功能。学习到的门被折叠到模型权重中,无需额外的推理时参数。在网络购物、工具使用、信息检索和实体交互这四项交互任务中,BACAM 的平均成功率为 62.82%,比最强的评估合并基准高出 21.69 个百分点。我们的代码可在 https://github.com/shuaitongli/BACAM. 上公开获取

BACAM:用于多轮交互的行为感知持续智能体合并的原论文方法或结果图
图 2:BACAM 概述。 (a) BACAM 根据当前合并模型和传入专家构建合并候选,收集交互轨迹,并通过任务和张量级控制优化门。 (b) 在候选生成的历史上,新任务可塑性控制(NPC)使用前向 KL 来获取传入专家的行为,而旧任务稳定性控制(OSC)将反向 KL 限制为当前合并模型以保留现有行为。 (c) 张量级冲突感知可塑性预算 (CAPB) 使用本地梯度探针来识别冲突并限制对冲突张量中传入专家的门更新。