论文

面向多智能体推理与协作的弱环节优化

Weak-Link Optimization for Multi-Agent Reasoning and Collaboration

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

LLM 驱动的多智能体框架通过多角色协作来解决复杂推理任务。然而,现有方法常受推理不稳定之苦:个体智能体的错误会在协作中被放大,损害整体表现。当前研究主要聚焦于增强高能力智能体或抑制不可靠输出以提升框架效果,而对限制性能的智能体进行系统性识别与强化则较少受到关注。为填补这一空白,我们提出 WORC,一个基于弱环节(weak-link)原则、面向多智能体推理与协作的弱环节优化框架。WORC 遵循两阶段工作流。在弱智能体定位阶段,先构造任务特征,一个基于元学习的权重预测器——它在由群体智能算法(SIAs)识别出的最优配置上训练——实现从这些特征到智能体性能权重的零样本映射,预测权重最低的智能体即被认定为弱智能体。在弱环节优化阶段,一种由不确定性驱动的分配策略向弱智能体分配额外的推理预算,预测权重越低,重复采样配额越大,以补偿其可靠性不足。实验结果表明,WORC 在推理基准上取得平均 82.2% 的准确率,同时提升了框架稳定性与跨架构泛化能力,这表明补偿弱环节而非只强化强项,能增强多智能体系统的鲁棒性。

面向多智能体推理与协作的弱环节优化:论文配图
图2:AC框架中的WORC方法概述。 (a)弱代理定位:通过SIA训练构建权重知识库,并生成任务签名。元学习预测器输出最适合新任务的权重向量,从而能够识别和评估弱代理。 (b) 弱代理优化:预测的权重向量指导推理预算的有针对性的分配,以补偿表现不佳的代理。代理在 AgentChain 框架内按顺序执行,VoteAgent 选择最佳输出以实现协作推理和性能优化。