论文

多代理 LLM 共识系统中的内部攻击

Insider Attacks in Multi-Agent LLM Consensus Systems

模型评测安全与风险评测

摘要

大语言模型 (LLM) 越来越多地部署在多代理系统中,其中代理以自然语言进行通信以共同解决任务。此类系统的一个关键功能是形成共识,其中代理迭代地交换消息并更新决策以达成共享结果。然而,大多数现有的多代理 LLM 框架假设所有参与代理都与系统目标保持一致。实际上,恶意内部人员可能会作为该组织的合法成员参与其中,同时追求隐藏的敌对目标。在这项工作中,我们研究多代理 LLM 共识系统中的内部操纵。我们将问题形式化为一个顺序决策任务,其中恶意代理试图延迟或阻止良性代理之间达成协议。为了使攻击优化易于处理,我们提出了一个基于世界模型的框架,该框架学习良性代理的潜在行为状态的代理动态,然后基于该学习模型使用强化学习来训练攻击者。初步结果表明,经过训练的攻击者比直接恶意提示基线更有效地降低了良性共识率并延长了分歧。这些结果表明,将潜在世界模型与强化学习相结合是基于语言的多智能体系统中自适应内部攻击的一个有前途的方向。