论文
当理解成为一种风险:新兴图像生成范式中的真实性和安全风险
When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm
摘要
最近,多模态 大语言模型 (MLLM) 已成为语言和图像生成的统一范例。与扩散模型相比,MLLM 具有更强的语义理解能力,使其能够处理更复杂的文本输入并理解更丰富的上下文含义。然而,这种增强的语义能力也可能带来新的、潜在的更大的安全风险。以扩散模型为参考点,我们从不安全内容生成和虚假图像合成两个维度系统地分析和比较新兴MLLM的安全风险。在多个不安全生成基准数据集中,我们观察到 MLLM 往往比扩散模型生成更多不安全图像。出现这种差异的部分原因是扩散模型通常无法解释抽象提示,从而产生损坏的输出,而 MLLM 可以理解这些提示并生成不安全的内容。对于当前先进的假图像检测器来说,MLLM 生成的图像也特别难以识别。即使使用 MLLM 特定数据对检测器进行重新训练,仍然可以通过简单地为 MLLM 提供更长、更具描述性的输入来绕过它们。我们的测量表明,尖端生成范式 MLLM 的新兴安全风险尚未得到充分认识,这对现实世界的安全提出了新的挑战。