论文

VETO:保护图像免受前沿人工智能编辑的影响

VETO: Towards Protecting Images From Frontier AI Editing

AI 基础设施AI安全与内容治理基础设施

摘要

FLUX.2 等功能强大、易于使用的图像编辑模型的兴起使高保真编辑触手可及。他们的功能现在不仅限于本地修改,还可以在全新的场景中提取对象和身份并对其进行重新上下文化。通过允许提示和生成标记直接参与参考图像标记,现代模型模糊了传统编辑和文本到图像合成之间的界限。这种扩大的生成自由也扩大了潜在滥用的空间,因为有害的转换不再局限于一组可预测的本地化编辑。现有的反编辑防御旨在破坏传统扩散管道中参考图像编码的语义瓶颈。然而,新的编辑者通过联合注意力块提取参考信息,从而经常规避这些保护。因此,我们引入了 VETO,这是一种微妙的反编辑斗篷,它破坏了现代模型读取源图像的​​内部机制。此外,由于现有的编辑基准在很大程度上未测试全面的重新语境化,因此我们引入了 VetoBench,它不仅评估传统本地化编辑的防御,还评估更广泛的语境转变的防御。在两种当代编辑模型和三个基准中,VETO 始终优于现有防御措施,同时提供更强的保护与保真度权衡。