论文

聊天中拒绝,用代码写成:IDE中工作流级越狱构建 编码智能体

Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents

模型评测安全与风险评测

摘要

大语言模型 越来越多地部署为 IDE 集成的 编码智能体,它可以分解任务、生成和编辑文件、运行代码以及多次优化输出。然而,它们的安全性仍然经常被当作聊天机器人来评估:一种有害的提示,一种反应,单独判断。我们引入了工作流级越狱构建,这是一种故障模式,其中有害目标是在软件开发工作流的普通阶段组装的,而不是通过单个直接提示生成的。在 Visual Studio Code 中使用 GitHub Copilot,我们研究了四种封闭权重后端:Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro 和 Gemini 3.5 Flash。在来自 Hammurabi's Code、HarmBench 和 AdvBench 的 204 个提示中,模型在直接聊天、CSV 读取和单步代码修复基线下显示出近乎完全拒绝,在每个基线条件下只有 8/816 成功响应。然而,在完整的工作流程下,相同的提示和后端会产生 816/816 个不安全的教学镜头完成结果,所有这些都由两名专家评估员在严格的规则下独立确认。这些结果表明,对话拒绝基准可能会大大夸大已部署的 编码智能体 的安全性,并激发防御措施,对多回合 IDE 工作流程及其生成的工件(而不仅仅是单个聊天回合)的安全性进行推理。