论文

MASPO:LLM多智能体系统的联合提示优化

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

智能体系统Agent 协作

摘要

基于大语言模型(LLM)的多智能体系统(MAS)在处理复杂协作任务上展现出前景,其中智能体通常经角色特定提示编排。虽然这些提示的质量至关重要,跨交互智能体联合优化它们仍是棘手挑战,主要因局部智能体目标与整体系统目标间的错位。为此我们提出MASPO:一个自动迭代精化整个系统提示的新框架。MASPO的核心创新是其联合评估机制:评估提示不仅看其局部有效性,更看其促成后继智能体下游成功的能力——无需真值标签即有效弥合局部交互与全局结果间的鸿沟。此外MASPO采用数据驱动的演化束搜索高效导航高维提示空间。跨6个多样任务的大量实证评估显示MASPO一致超越SOTA提示优化方法,平均准确率提升2.9。代码开源于GitHub。

MASPO:LLM多智能体系统的联合提示优化:论文配图
图 1:MASPO 框架概述。优化按照代理图(右上)的拓扑顺序顺序进行。 (上)对于特定的目标代理,提示优化器会分析采样批次 ℬi​t​e​r∪ℬm​i​s\mathcal{B}_{iter}\cup\mathcal{B}_{mis} 中的执行跟踪(上下文 𝒞\mathcal{C} 和输出 oo)以生成候选提示𝒫c​a​n​d\mathcal{P}_{cand}。这些候选人由LLM评估员从三个不同的维度进行严格评估:本地依从性、前瞻性潜力和全球一致性。 (左下)为了解决学分分配问题,我们将这些评估综合到联合奖励模型中。至关重要的是,我们识别并挖掘错位案例,以明确指导优化器修复协调故障。 (右下)在高维搜索空间中导航时,该框架采用了跟踪引导波束搜索。该机制维护了一系列 Top-K 候选者,沿着迭代演化的路径累积联合奖励分数并选择最佳提示。