论文

领域通用人脸反欺骗的视觉基础模型基准测试

Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing

模型评测模型能力评测

摘要

由于需要跨未知环境进行稳健的域泛化,人脸反欺骗 (FAS) 仍然具有挑战性。虽然最近的趋势利用视觉语言模型 (VLM) 进行语义监督,但这些多模态方法通常需要大量的计算资源并表现出较高的推理延迟。此外,它们的功效本质上受到底层视觉特征质量的限制。本文重新审视了纯视觉基础模型的潜力,为 FAS 建立高效且稳健的基线。我们在包括 MICO 和有限源域 (LSD) 协议在内的严格跨域场景下对 15 个预训练模型(例如监督 CNN、监督 ViT 和自监督 ViT)进行了系统基准测试。我们的综合分析表明,自我监督视觉模型,特别是带有寄存器的 DINOv2,可以显着抑制注意力伪影并捕获关键的、细粒度的欺骗线索。结合人脸反欺骗数据增强(FAS-Aug)、逐块数据增强(PDA)和注意力加权补丁丢失(APL),我们提出的仅视觉基线在 MICO 协议中实现了最先进的性能。该基线优于数据受限 LSD 协议下的现有方法,同时保持卓越的计算效率。这项工作为 FAS 提供了明确的纯视觉基线,证明优化的自监督视觉 Transformer 可以作为纯视觉和未来多模态 FAS 系统的支柱。该项目页面位于:https://gsisaoki.github.io/FAS-VFMbenchmark-CVPRW2026/。