用于人脸呈现和变形攻击检测的基础和多模态 大语言模型
Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection
摘要
人脸识别系统越来越多地部署在安全关键型应用中,但它们仍然容易受到演示和变形攻击。因此,呈现攻击检测 (PAD) 和变形攻击检测 (MAD) 是值得信赖的人脸生物识别技术的重要组成部分。尽管 PAD 和 MAD 方法取得了进步,但现有检测器的泛化能力有限,并且在跨数据集评估方面性能下降。在本文中,我们系统地研究了通用基础模型 (FM) 和多模态 大语言模型 (MLLM) 是否编码 PAD 相关和 MAD 相关信息,以及如何最好地为这两项任务部署这些模型。我们研究了五种增加对模型内部信息的访问的方法:(i)现成 MLLM 的零样本提示; (ii) 根据 MLLM 输出的下一个词元 logits 概率训练浅层模型; (iii) 针对特定任务的问答数据的参数高效 微调,产生两个专门的 MLLM,称为 PADLLM 和 MADLLM,它们还为其决策提供文本推理; (iv) 冻结视觉编码器的线性探测; (v) FM 和 MLLM 视觉编码器的 微调。我们在四个 PAD 数据集(MSU-MFSD、CASIA-FASD、Replay-Attack 和 OULU-NPU)和四个 MAD 数据集(FFHQ、FRGC、FRLL 和 FERET)上对 16 个开放权重 MLLM 和 30 个视觉编码器主干进行了基准测试。我们的实验表明,FM 和 MLLM 可以在 PAD 和 MAD 方面实现显着的性能。此外,经过微调的模型在跨数据集评估中实现了最先进的检测性能,这表明通用预训练表示携带了大量与攻击相关的信息。我们所有实验的源代码都将公开发布。