论文
大规模LLM智能体安全测试:从风险发现到证据落地的验证
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
摘要
LLM智能体日益经外部工具执行自主动作——带来复杂且演化的安全风险。但既有安全测试针对专家设计的安全违例——相应结果由硬编码规则评估——随智能体演化扩展成本高昂。为此——我们提出Vera——端到端自动化安全测试框架——经三阶段自增强管线为非确定性智能体实例化软件工程测试原则。第一——文献驱动的探索持续发现新涌现风险并将其结构化为安全风险、攻击方法与工具执行环境的分类法。第二——跨分类法维度的组合式组合产出可执行安全案例——每个指定具体安全目标、程序化构造的初始状态——以及锚定于可观察工件的确定性验证谓词。第三——自适应执行在隔离沙箱中运行异构智能体——控制智能体基于运行时观察引导多轮交互——而证据锚定的验证器从环境状态与工具调用证据而非模型自报判断结果。我们在四个生产智能体框架(OpenClaw、Hermes、Codex、Claude Code)上评估Vera——揭示大量安全弱点:多通道攻击下平均攻击成功率高达93.9%;我们还发布Vera-Bench——含跨三种执行设置、124个风险类别的1600个可执行安全案例。这些结果表明模块化、可执行的测试基础设施对快速演化智能体系统的严格可维护大规模安全评估必不可少。代码公开于 https://github.com/Yunhao-Feng/Vera。
