论文
KSAFE-MM:通过本地化韩国文化风险情境的多模式安全基准
KSAFE-MM: A Multimodal Safety Benchmark via Localized Contextualization for Korean Cultural Risks
摘要
多模式 大语言模型 (MLLM) 通过跨多种模式(例如语言和视觉)引入漏洞,加剧了安全风险。然而,当前的 MLLM 安全评估工具存在重大局限性:1)以英语为中心的数据集构建,2)关注与当地文化背景无关的一般风险。本文介绍了 KSAFE-MM,这是韩国多模式安全评估的基准,涵盖一般安全风险和特定文化的漏洞。 KSAFE-MM 由两个互补的部分组成:KSAFE-MM-G 通过语言情境化评估韩国语境中的全球共享风险,将通用安全查询转换为基于情境的多模态样本。相比之下,KSAFE-MM-C 使用从现实世界中提取的本地化视觉查询来针对文化相关的安全漏洞。它将这些视觉查询与越狱式文本查询配对,以涵盖涉及文化视觉提示和恶意文本意图的多模式安全风险。我们在 KSAFE-MM 上评估了 12 个最先进的 MLLM,并揭示了基于翻译的评估无法捕获的基于文化的漏洞。值得注意的是,越狱策略大大提高了攻击成功率,ProgramExecution 的 ASR 高达 74.2%,而标准查询的 ASR 为 13.4%。此外,我们确定了安全性和过度拒绝之间的系统权衡,其中实现低 ASR 的模型往往会对良性查询表现出过度拒绝行为。这些发现凸显了迫切需要超越以英语为中心的基准,进行基于文化的安全评估。