论文
仅基于 LoRA 的适应是不够的:了解人脸呈现攻击检测基础模型的局限性
LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection
摘要
人脸呈现攻击检测 (PAD) 旨在可靠地检测各种呈现攻击。虽然 PAD 方法在单个数据集内实现了强大的性能,但在跨数据集评估下其性能会下降。传感器或照明条件的变化可能会将探测器的有效性从近乎完美降低到近乎随机。基础模型 (FM) 已成为一种有前景的替代方案,因为典型的 PAD 数据集(例如 MCIO 基准(MSU-MFSD、CASIA-FASD、Replay-Attack 和 OULU-NPU))相对于基于网络的预训练所使用的规模较小。然而,现有的 PAD 系统主要关注基于 CLIP 的基础模型,而忽略了具有不同架构和训练程序的其他 FM。本研究通过系统评估 32 个 FM 来解决这个问题。零样本提示几乎可以在模型系列和规模上实现性能。视觉编码器在低秩适应 (LoRA) 且可训练权重少于 1% 时,在大多数情况下可实现低于 2% 的数据集内 ACER,而跨数据集 ACER 则要高得多。 LoRA 主要细化数据集中的决策边界,这表明预训练表示和适应数据集在跨数据集泛化中比评估的轻量级适应策略发挥更大的作用。