开源项目

mllm-jailbreak-bench:多模态模型越狱评测基准

ziyuwowo/mllm-jailbreak-bench

模型评测安全与风险评测

概述

mllm-jailbreak-bench 是一个面向多模态大模型的安全评测基准,独立解决越狱攻击与安全风险度量问题。多模态模型的攻击面除文本外还包括图文组合等跨模态绕过,仅做文本安全测试难以覆盖,该基准可为模型上线前的安全评估和红队测试提供标准化的攻击样例与评测口径。本次公开材料未披露攻击样例规模与覆盖的攻击类型,使用前可在仓库进一步确认。