论文

DINO-VPT:针对联合物理数字人脸反欺骗的分层视觉提示调整

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

模型训练参数高效训练

摘要

随着欺骗攻击的日益多样化,对能够检测物理和数字威胁的统一人脸反欺骗 (FAS) 模型的需求不断增长。虽然现有的视觉语言模型(VLM)在这方面表现出高度的泛化性,但它们严重依赖复杂的多模态融合和外部文本编码器。在本文中,我们提出了 DINO-VPT,这是一种利用分层视觉提示调整的轻量级、仅视觉的框架。通过通过提示路由网络(PRN)动态注入以输入特征为条件的提示,我们的方法有效地解开了各种欺骗伪影,而不需要多模态融合。对 UniAttackData 基准的评估表明,DINO-VPT 比最先进的基于 VLM 的方法具有更高的准确性。我们的结果表明,结构合理的纯视觉架构可以在统一 FAS 中实现最先进的性能,而无需多模态监督。