论文
VeriGrey:灰盒智能体验证
VeriGrey: Greybox Agent Validation
摘要
智能体AI近来备受关注。大型语言模型(LLM)智能体在后端涉及一个或多个LLM,在前端则通过将LLM输出与调用多个外部工具所获得的结果相结合来进行自主决策。与外部环境的自主交互带来了关键的安全风险。本文提出一种灰盒方法,用于探索LLM智能体的多样行为并揭示其安全风险。我们的方法VeriGrey利用被调用工具的序列作为反馈函数来驱动测试过程,这有助于发现那些罕见但危险、会导致智能体意外行为的工具调用。作为测试过程中的变异算子,我们对提示词进行变异以设计恶意的注入提示词。这一步通过将智能体的任务与注入任务相耦合来精心实现,使注入任务成为完成智能体功能的必要步骤。在著名的AgentDojo基准上将我们的方法与黑盒基线比较,VeriGrey在以GPT-4.1为后端时,发现间接提示注入漏洞的效能额外提高了33%。我们还在广泛使用的编程智能体Gemini CLI和知名的OpenClaw个人助手上开展了真实案例研究。VeriGrey发现了多种黑盒方法无法识别、可诱发若干攻击场景的提示词。在OpenClaw中,通过构建一个按需采用变异模糊测试的对话智能体,VeriGrey能够从10个恶意技能中发现恶意技能变体(在Kimi-K2.5 LLM后端上成功率为10/10=100%,在Opus 4.6 LLM后端上为9/10=90%)。这证明了VeriGrey这类动态方法在测试智能体方面的价值,并最终有望催生智能体保障(agent assurance)框架。