论文

AIR-BENCH Live:一个不断演进的基础模型安全基准

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

模型评测基准与评测资源

摘要

基础模型安全基准反映的是其发布时点的AI风险:随着模型进步和各国政府通过新的AI安全立法,其风险分类体系变得不全面,攻击提示也趋于失效。我们提出AIR-BENCH Live,它是AIR-BENCH 2024的自我演进后继版本。自动化更新流水线监控政府法规,并依据当前四级风险分类体系对新政策进行归类,或将其匹配到既有类别,或提出新的细粒度类别。随后,多智能体、人设驱动的提示生成算法在极少人工审核下生成逼真的多语言提示,为结合现代越狱技术的改进留出空间。该算法被用于全面翻新旧有提示并为新类别生成提示。在当前版本中,该流水线已将基准从314个细粒度风险扩展至335个,其中21个新类别源自七个司法辖区的31条真正新颖的政策条款。对14个近期模型的评估发现:安全水平差异悬殊(在按自身行为进行评判的模型中得分从0.17到0.89);现代化提示平均比2024年提示集难0.06分,且最大降幅集中在最守规范的模型上;大多数模型在非英文提示上的安全性略低。通过持续吸纳新法规并重新生成提示,AIR-BENCH Live旨在与快速发展的领域同步演进。