论文

OrchJail:通过编排引导模糊测试调用文本到图像代理的越狱工具

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

模型评测安全与风险评测

摘要

工具调用文本到图像 (T2I) 代理可以规划和执行多步骤工具链,以完成复杂的生成和编辑查询。然而,此功能引入了新的安全攻击面:工具编排可能会产生有害输出,其中单独的良性步骤组合成不安全的结果,使得仅提示越狱技术不够。我们推出了 OrchJail,一个编排引导的模糊测试框架,用于越狱工具调用 T2I 代理。其核心思想是利用高风险的工具编排模式:通过学习成功的越狱工具调用痕迹及其与提示措辞的因果关系,OrchJail 直接引导模糊搜索更容易触发不安全的多步骤工具行为的提示,而不是依赖于表面级别的文本扰动。大量实验表明,OrchJail 提高了代表性工具调用 T2I 代理的越狱有效性和效率,实现了更高的攻击成功率、更好的图像保真度和更低的查询成本,同时保持了针对常见越狱防御的稳健性。我们的工作强调工具编排是一个关键的、以前未探索过的攻击面,并为发现 T2I 代理中的安全风险提供了一个新颖的框架。