论文

温水煮青蛙:代理安全的多轮基准

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

智能体系统模型评测Agent任务评测安全与风险评测

摘要

背景。语言模型的传统安全基准评估生成的文本:模型是否输出有毒语言、再现偏见或遵循有害指令。当模型被部署为代理时,与安全相关的对象从系统所说的内容转变为它在环境中所做的事情,并且在提示下评估模型响应不再足以解决人工智能带来的安全挑战。最近的发展见证了评估 大语言模型 作为代理的基准的兴起。我们为这方面的研究做出了贡献。方法。我们推出了煮青蛙(Boiling the Frog),这是一个基准,用于评估在企业和办公室环境中部署的使用工具的人工智能模型是否容易受到增量攻击。每个场景都从良性工作区编辑开始,然后引入风险承担请求。该基准测试侧重于有状态的多回合评估:链公开持久的工作空间,将承担风险的有效负载放置在回合序列中的受控位置,并对生成的工件状态是否变得不安全进行评分。情景通过三级操作风险分类法进行组织,该分类法基于“温水煮青蛙”风险、《人工智能法》附件一和附件三高风险背景以及《欧盟人工智能法》通用人工智能实践守则(GPAI)。结果。在九个模型面板中,严格攻击总成功率 (ASR) 为 44.4%。模型级 ASR 范围从 Claude Haiku 4.5 的 20.5% 到 Gemini 3.1 Flash Lite 的 92.9%,Seed 2.0 Lite 也高于 80%。对于《行为准则》失控场景,平均连锁类别级 ASR 达到 93.3%。