论文

角色条件对抗性提示:用于对抗性发现和缓解的多身份红队

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

模型评测安全与风险评测

摘要

LLM 的自动红队经常会发现狭窄的攻击切片,遗漏了各种现实世界的威胁,并且产生的安全数据不足 微调。我们引入了角色条件对抗提示(PCAP),它对不同的攻击者角色(例如医生、学生、恶意行为者)和策略集进行对抗性搜索,以探索现实的攻击场景。通过运行并行的角色条件搜索,PCAP 发现不同环境中的可转移越狱,并通过自动元数据跟踪生成丰富的防御数据集。在 GPT-OSS 120B 上,PCAP 将攻击成功率从 57\% 提高到 97\%,同时产生涵盖各种现实场景的 2-6$\times 更多样化的提示。至关重要的是,基于 PCAP 生成的数据的 微调 轻量级适配器显着提高了模型稳健性(召回率:0.36 $\rightarrow$ 0.99,F1:0.53 $\rightarrow$ 0.96),误报率极低,展示了从漏洞发现到自动对齐的实用闭环方法。