论文

多模态大语言模型智能体使用工具时的拒绝失效

MLLMs Fail to Refuse when Using Tools Agentically

模型评测安全与风险评测

摘要

Agentic 多模态 大语言模型 (MLLM) 最近通过调用缩放和标记等工具推动了视觉推理的前沿。尽管 Agentic MLLM 最近取得了巨大成功,但这项工作揭示了工具使用范式中的一个关键安全故障:使用 Agentic 工具的 MLLM 拒绝有害请求的能力变得较差。我们的实验证实,在三个流行的安全基准中,我们测试的所有顶级开放式和封闭式重量 MLLM 在使用工具的设置中的安全性明显低于在非工具设置中的安全性,相对拒绝故障率增加高达 68.7%。基于对 100,000 多个响应的分析(包括扩展实验),我们还提出了这种安全性下降的两个可能原因。

多模态大语言模型智能体使用工具时的拒绝失效的原论文方法或结果图
图 1:使用工具时,多模式 大语言模型 (MLLM) 更有可能无法拒绝有害请求。该示例显示了有关如何扒窃的用户请求,模型应拒绝回答该请求。条形图中的值为 $\Delta\text{RFR}$。详细结果见表1。