论文

MiniRep:用于多Agent辩论的稳健的基于信誉的聚合

MiniRep: Robust Reputation-Based Aggregation for Multi-Agent Debate

智能体系统Agent 协作

摘要

由大语言模型 (LLM) 提供支持的自主Agent正在迅速发展成为开放的 Agentic 生态系统。为了支持值得信赖的协作,行业计划越来越多地根据过去的行为评估座席声誉并提供绩效排行榜。然而,从过去的表现中获得的声誉可能无法可靠地预测Agent在新任务中的行为,特别是当恶意Agent可以在协作期间调整其行为并影响其他Agent时。我们研究多智能体辩论(MAD)中的声誉,其中多个智能体回答相同的查询,进行辩论以改进他们的答案,并将它们聚合成最终输出。我们推出了 MiniRep,这是一种基于信誉的恶意Agent下 MAD 聚合系统。为了将我们的威胁模型建立在既定研究的基础上,我们根据声誉系统攻击和软件测试突变算子构建了一个攻击分类法,涵盖了声誉的战略利用和Agent提案的微妙腐败。在这种分类法的指导下,MiniRep 根据Agent在当前任务中的行为以及一段时间内的声誉来评估Agent,同时防止具有高度相似响应的Agent群体主导最终决策。我们评估 MiniRep 的不同任务、LLM Agent组成、腐败位置以及从我们的分类中得出的攻击类型。我们的实验结果表明,无论是否受到攻击,MiniRep 在 MATH 上都优于传统的 MAD 聚合和传统的基于声誉的方法。此外,在 MATH 的异构 10 Agent设置下,MiniRep 在所有 28 种攻击条件下均优于所有基线。