论文

多代理 LLM 系统中的联合提示攻击

Conjunctive Prompt Attacks in Multi-Agent LLM Systems

模型评测安全与风险评测

摘要

大多数 LLM 安全工作研究单代理模型,但许多实际应用依赖于多个交互代理。在这些系统中,即时分段和代理间路由创建了单代理评估所忽略的攻击面。我们研究\emph{联合提示攻击},其中用户查询中的触发键和一个受感染的远程代理中的隐藏对抗模板各自看起来是良性的,但当路由将它们聚集在一起时会激活有害行为。我们考虑攻击者既不改变模型权重也不改变客户端代理,而是仅控制触发器放置和模板插入。在星形、链形和 DAG 拓扑中,路由感知优化相对于非优化基线大大提高了攻击成功率,同时保持较低的错误激活率。现有的防御措施(包括 PromptGuard、Llama-Guard 变体和工具限制等系统级控制)无法可靠地阻止攻击,因为没有任何单个组件会单独出现恶意行为。这些结果暴露了代理 LLM 管道中的结构漏洞,并激发了对路由和跨代理组合进行推理的防御。代码可在 https://github.com/UCF-ML-Research/ConjunctiveAgents 获取。