论文
跨部门冲突作为盾牌:在统一多模态图像编辑中保护面部身份
Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing
摘要
统一多模态模型(UMM)最近展示了强大的基于指令的图像编辑功能,同时也引发了对未经授权操纵个人肖像的严重担忧。我们研究了一个新颖且实际的问题:保护面部身份免遭未经授权的 UMM 编辑。现有的基于扩散和基于 VLM 的保护方法常常变得无效,因为它们通常只破坏单个视觉分支。为了理解这一限制,我们对统一图像编辑模型中的理解和生成分支进行了特征级分析。我们的观察表明,这两个分支之间的结构一致性与成功的图像编辑密切相关。当只有一个分支失真时,模型仍然可以从另一分支恢复身份信息。基于此,我们提出了跨部门冲突作为盾牌(CCS),一个统一的对抗性保护框架。 CCS 共同推动 ViT 和 VAE 代表远离干净的代表。它还使用线性居中内核对齐 (CKA) 目标来破坏两个分支之间的结构一致性。通过降低视觉通路中可靠的身份信息并引入不兼容的跨分支表示,CCS 有效地防止 UMM 在编辑过程中恢复一致的面部身份线索。大量实验表明,CCS 在抑制身份保留编辑方面始终提供更强的保护。代码位于补充材料中。