论文

MS-MFAD:用于人脸反欺骗检测的多模态 大语言模型

MS-MFAD : Multimodal large language models for Face Anti-spoofing Detection

模型训练监督微调与指令调优

摘要

面部生物识别系统目前面临着生成人工智能和高保真物理欺骗交织在一起的复合威胁。现有的防御措施存在系统性瓶颈,包括泛化能力差、推理不可审计以及对大量低质量数据集的依赖。为了应对这些挑战,我们提出了用于人脸反欺骗检测的多模态 大语言模型 (MFAD),这是一种用于统一人脸反欺骗检测 (UFAD) 的可解释推理系统,并附带语义级注释基准。与依赖外部工具或粗略对齐的方法不同,MFAD 通过细粒度像素语义锚定机制激活 Multimodal 大语言模型 (MLLM) 的内在推理能力。这消除了定位幻觉并确保了可审计的推理路径。我们引入了跨攻击语义级统一注释范式:通过为每个攻击类别仅注释 1,000 个精确掩码,我们生成与欺骗区域严格对应的推理证据链。 Qwen-VL基础模型上的监督微调表明,使用有限的高质量样本,该系统实现了域内ACER相对降低40-50%,并将跨域性能下降限制在11.62%/5.23%以内,显着优于现有框架。此外,在白盒对抗攻击下,检测准确率仅下降 3.2%,验证了语义锚定与在海量短文本数据上训练的模型相比的鲁棒性。领域从业者对推理路径的证据可靠性评分为4.57/5,推理延迟满足实时部署要求。这些结果证实,少量、高质量的语义注释范式对于构建可信、可解释且经济高效的 UFAD 系统是有效的。