论文

MOSCOPT:基于技能混合的协同优化方法用于大语言模型智能体

MOSCOPT: Mixture-of-Skills Collective Optimization for LLM Agents

智能体系统Agent Skills

摘要

自然语言提示和技能是大语言模型智能体的策略核心。近期在提示和技能优化方面取得显著进展,但现有方法仅优化单一文本模板,忽略了多种互补策略间的协同作用。我们提出MOSCOPT,一种原生文本、无参数的算法,联合优化N个技能以及一个门控技能G,该门控技能每步动态选择K个技能。为有效优化技能,我们构建了具备内部双状态维护机制的EditAdam。通过EditAdam的三阶段交错更新,系统单调提升,无需梯度或参数调优。在5个基准和3个目标大语言模型上的广泛实验及详细消融研究表明,MOSCOPT在各项指标上均优于所有基线方法,证实了技能混合架构与选择性激活以及三阶段交错协同进化对性能提升的必要性。代码已开源,地址为该https URL。

MOSCOPT:基于技能混合的协同优化方法用于大语言模型智能体:论文配图
图 1:MOSCOPT 维护三个核心组件:技能池 𝒮={s1,…,sN}\mathcal{S}=\{s_{1},\ldots,s_{N}\}、门控技能 GG 和汇总表 Σ⁡(𝒮)\Sigma(\mathcal{S})。给定任务输入,GG 通过 Σt​(𝒮)\Sigma_{t}(\mathcal{S}) 选择 KK 技能,输出 ACTIVATE ID(具有最高 KK-by-Q-score 回退)。 KK 激活的技能会加载到代理上下文中,而未激活的技能则保持不可见。