论文

大规模LLM智能体安全测试:从风险发现到证据落地的验证

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

模型评测AI 基础设施Sandbox安全与风险评测Agent Sandbox

摘要

LLM智能体日益经外部工具执行自主动作——带来复杂且演化的安全风险。但既有安全测试针对专家设计的安全违例——相应结果由硬编码规则评估——随智能体演化扩展成本高昂。为此——我们提出Vera——端到端自动化安全测试框架——经三阶段自增强管线为非确定性智能体实例化软件工程测试原则。第一——文献驱动的探索持续发现新涌现风险并将其结构化为安全风险、攻击方法与工具执行环境的分类法。第二——跨分类法维度的组合式组合产出可执行安全案例——每个指定具体安全目标、程序化构造的初始状态——以及锚定于可观察工件的确定性验证谓词。第三——自适应执行在隔离沙箱中运行异构智能体——控制智能体基于运行时观察引导多轮交互——而证据锚定的验证器从环境状态与工具调用证据而非模型自报判断结果。我们在四个生产智能体框架(OpenClaw、Hermes、Codex、Claude Code)上评估Vera——揭示大量安全弱点:多通道攻击下平均攻击成功率高达93.9%;我们还发布Vera-Bench——含跨三种执行设置、124个风险类别的1600个可执行安全案例。这些结果表明模块化、可执行的测试基础设施对快速演化智能体系统的严格可维护大规模安全评估必不可少。代码公开于 https://github.com/Yunhao-Feng/Vera。

大规模LLM智能体安全测试:从风险发现到证据落地的验证:论文配图
图 1:Vera 概览。该框架不断扩展基于文献的安全风险、攻击方法和环境分类,并将其元素组成安全目标和可执行场景。在良性、单通道和多通道条件下,通过隔离的、有状态的沙箱中的通用接口来评估异构代理。测试端控制代理根据运行时观察调整交互,而特定于案例的验证程序根据环境状态、工具调用证据和代理响应确定结果。经过验证的执行将保留为可重播的安全记录,并为后续风险探索和场景细化提供反馈。