论文

了解你的智能体:侦察驱动的AI智能体渗透测试

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

模型评测安全与风险评测

摘要

传统渗透测试在每一步使用侦察以发现未见弱点、构建更强攻击并推进目标;我们认为AI智能体需要同样的对待。我们形式化智能体侦察:对该过程建模,并识别其试图抽取的知识资产——它们是什么、如何被使用、以及它们利用哪些智能体弱点来在间接提示注入攻击中给对手杠杆。我们在Know Your Agent(KYA)框架中实例化这些洞见:自动化黑盒、侦察驱动的渗透测试——探测智能体、构建目标画像,并用这些画像打造更强的攻击。我们在智能体安全基准与一个真实编码智能体上评估KYA,并发布KYA、其基准与基线实现以供复现。

了解你的智能体:侦察驱动的AI智能体渗透测试:论文配图
图 3:KYA 概述。答: \scriptsize1⃝ Orchestrator 决定是否使用当前目标配置文件 ℳ\mathcal{M} 执行侦察或攻击; \scriptsize2⃝ 相应的模块使用 ℳ\mathcal{M} 创建有效负载。 B: \scriptsize3⃝ 使用有效负载评估代理,\scriptsize4⃝ Orchestrator 相应地更新 ℳ\mathcal{M}。循环至A。