论文

通过结构化模板注入自动化智能体劫持

Automating Agent Hijacking via Structural Template Injection

模型评测安全与风险评测

摘要

智能体劫持被 OWASP 列为大语言模型(LLM)生态的关键威胁,攻击者通过向检索内容注入恶意指令操纵执行。现有攻击大多依赖人工构造、语义驱动的提示操纵,攻击成功率往往较低,对闭源商业模型的可迁移性有限。本文提出 Phantom,一个建立在结构化模板注入之上的自动化智能体劫持框架,针对 LLM 智能体的底层架构机制。关键洞见是:智能体依赖特定聊天模板词元来分隔系统、用户、助手和工具指令。通过向检索上下文注入优化的结构化模板,我们诱发角色混淆,使智能体把注入内容误判为合法用户指令或先前的工具输出。为增强对黑盒智能体的攻击可迁移性,Phantom 引入新颖的攻击模板搜索框架:先进行多级模板增广以提升结构多样性,再训练模板自编码器(TAE)把离散模板嵌入连续、可搜索的潜空间,随后应用贝叶斯优化高效识别最优对抗向量,并解码为高效力结构化模板。在 Qwen、GPT 和 Gemini 上的大量实验表明,该框架在攻击成功率(ASR)和查询效率上都显著优于现有基线。此外,我们在真实商业产品中发现 70 多个已获厂商确认的漏洞,凸显结构化模板劫持的实际严重性,并为保护下一代 Agentic 系统提供实证基础。

通过结构化模板注入自动化智能体劫持
图3:Phantom概览。