论文
MLCommons越狱基准v1.0
MLCommons Jailbreak Benchmark v1.0
摘要
现代AI系统被设计为拒绝危险请求;越狱是绕过这些防护、诱导系统输出其通常会拒绝内容的提示。MLCommons越狱基准v1.0为评估大语言模型对单轮文本越狱攻击的鲁棒性提供端到端方法学:把标准驱动的系统与攻击选择、配对的基线与对抗评估、人工标注、自动评估器校准、打分、分级与风险校准披露结合进单一评测管道。基准使用横跨十一个危害类别、取自MLCommons越狱分类法的代表性攻击评估八个开放权重系统;响应按AILuminate评估标准v1.4评定,鲁棒性以韧性差距(基线与对抗条件间安全性能变化)度量。跨全部受评系统与攻击,不安全响应率从基线条件的11.08%升至越狱条件的18.65%,平均韧性差距7.57%。易获取系统平均差距更大,攻击有效性在攻击类别与危害间差异显著。基准还考察评估器可靠性与测量误差来源。除报告结果外,越狱基准v1.0为比较性越狱评估及未来向更多系统、攻击、危害与评估方法的扩展确立可复现的方法学基础。