论文

人脸呈现攻击检测的基础模型:统一的线性探测基准

Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

模型评测基准与评测资源

摘要

人脸呈现攻击检测(PAD)在跨数据集评估下仍然具有挑战性,其中域转移会降低在单个数据集上训练的模型的性能。大规模标记数据的稀缺促使人们采用预训练的视觉模型,而不是从头开始训练特定于任务的架构,这就提出了一个基本问题:通用视觉基础模型是否可以通过最少的特定任务训练来编码可访问的 PAD 相关信息?为了进行研究,我们使用 MCIO 基准(MSU-MFSD、CASIA-FASD、Replay-Attack、OULU-NPU)上的统一线性探测协议,系统地评估了 24 个冻结编码器,包括自监督视觉 Transformer、视觉语言编码器和监督 CNN。主干保持固定,仅训练轻量级线性头来隔离预训练表示中已存在的 PAD 信息。结果表明,冻结的基础模型表示仅使用线性分类器就可以支持强大的数据集内 PAD 性能,但这种性能不能可靠地跨数据集传输。模型规模在多个系列中是有益的,尽管效果不是单调的并且受到架构和预训练的强烈调节。 InternViT-6B 实现了最低的平均数据集内误差,而 CLIP ViT-B/32 在评估的探针中提供了最有利的跨数据集传输计算权衡。这些发现表明,虽然预训练的表示包含 PAD 相关信息,但仍需要显式适应来解决域转移问题。