论文
AdversaBench:带多裁判确认与跨模型迁移性的自动化LLM红队测试
AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability
摘要
扩展大语言模型的对抗评估既需要生成困难输入的方法——也需要确认所得失败为真的可靠途径。我们提出AdversaBench——端到端红队管线:以五个结构化算子变异种子提示、查询目标模型——并经三裁判组与元裁判决胜确认失败。我们报告跨推理、指令遵循与工具使用三类别45个种子的实验。每个种子都产生一次确认失败。四个发现突出。第一——算子有效性因类别剧烈变化:inject_distractor在指令遵循种子上平均奖励0.00——但在推理与工具使用上0.80-0.83。第二——二元失败率掩盖难度:指令遵循种子平均需2.4次攻击者迭代——其他类别1.1次——该差距在生存曲线中可见。第三——成对裁判一致率80-87%却因标签偏斜伴随近零Cohen's kappa——类别级分歧率信息量更大。第四——针对Llama 3.1 8B生成的对抗提示零样本迁移到Llama 3.3 70B——表明变异利用的是一般行为模式而非模型特定弱点。代码、数据集与分析脚本见 https://github.com/khanak0509/AdversaBench。
