论文
使用多模态增强单图像面部变形 大语言模型
Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models
摘要
人脸识别系统越来越容易受到变形攻击,其中合成图像被精心设计以匹配多个身份,从而导致未经授权的访问和身份欺诈。现有的检测方法可以识别变形图像,但无法恢复组成图像或身份,限制了其取证效用。本文提出了一种新颖的无参考面部变形框架,该框架利用多模态 大语言模型 (MLLM) 来指导基于耦合扩散的重建过程。我们的关键创新在于从中间 MLLM 层提取语义嵌入来调节变形,提供有关面部属性和身份线索的高级推理,以补充低级像素信息。我们将变形表述为耦合条件生成问题,其中两个组成面通过直接在 RGB 域中运行的去噪扩散模型联合合成,确保身份间的一致性,同时保留细粒度的感知细节。与依赖压缩潜在表示或假设训练集和测试集之间的身份重叠的先前方法不同,我们的方法通过直接利用 MLLM 隐藏状态作为条件信号来绕过有损文本生成重新编码周期,使去噪网络能够处理微妙的视觉线索,例如头发、背景和面部纹理。消融研究进一步表明,中间 MLLM 层编码更多的身份区分表示,RGB 域变形在严格的操作点上优于潜在空间方法 30--40\%,并且完整的 MLLM 嵌入通过多模态预训练增强的语义结构提供了比原始 ViT 特征显着的优势。