论文

AdversaBench:带多裁判确认与跨模型迁移性的自动化LLM红队测试

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

模型评测安全与风险评测

摘要

扩展大语言模型的对抗评估既需要生成困难输入的方法——也需要确认所得失败为真的可靠途径。我们提出AdversaBench——端到端红队管线:以五个结构化算子变异种子提示、查询目标模型——并经三裁判组与元裁判决胜确认失败。我们报告跨推理、指令遵循与工具使用三类别45个种子的实验。每个种子都产生一次确认失败。四个发现突出。第一——算子有效性因类别剧烈变化:inject_distractor在指令遵循种子上平均奖励0.00——但在推理与工具使用上0.80-0.83。第二——二元失败率掩盖难度:指令遵循种子平均需2.4次攻击者迭代——其他类别1.1次——该差距在生存曲线中可见。第三——成对裁判一致率80-87%却因标签偏斜伴随近零Cohen's kappa——类别级分歧率信息量更大。第四——针对Llama 3.1 8B生成的对抗提示零样本迁移到Llama 3.3 70B——表明变异利用的是一般行为模式而非模型特定弱点。代码、数据集与分析脚本见 https://github.com/khanak0509/AdversaBench。

AdversaBench:带多裁判确认与跨模型迁移性的自动化LLM红队测试:论文配图
图 2:操作员有效性热图(每个操作员-类别对的平均奖励)。 ject_distractor 在推理和工具使用种子方面实现了 1.00 的平均奖励,但在指令遵循方面实现了 0.33,这证实没有任何一个操作员在所有类别中占主导地位。