论文

基于句级纠正防御LLM多智能体系统的协同攻击

Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification

智能体系统Agent 动作执行与治理

摘要

近年来,基于大语言模型的多智能体系统(MAS)快速发展,在协作决策与复杂问题求解上表现出色。然而,MAS中的恶意智能体可能注入错误信息来误导其他智能体并破坏系统性能,由此催生了一个聚焦MAS攻击机制与防御策略的新研究方向。以往研究大多假设恶意智能体独立行动,并研究相应的防御策略。然而,我们认为恶意智能体可能表现出协同行为,通过内部信息交换实现更有效的攻击。本文提出一个自适应协同攻击框架,其中恶意智能体通过多轮交互自主协调并动态调整攻击策略。此外,我们提出句级可信度分析与纠正(STAR),一个在智能体通信的句子层面识别并纠正误导信息的防御框架。我们的实验表明,协同攻击比独立攻击带来显著更大的任务成功率下降,相对下降达5.34%。同时,STAR能有效缓解协同与独立两类威胁,平均提升任务成功率36.76%。代码发布于https://github.com/smoooom/STAR。

基于句级纠正防御LLM多智能体系统的协同攻击:论文配图
图2:协同攻击方法与STAR防御框架总览,展示句级矫正如何抵御多智能体系统中的合作性攻击。