论文

用于开放世界人脸反欺骗的原始驱动组合取证视觉提示

Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing

模型训练参数高效训练

摘要

开放世界的人脸反欺骗必须解决协变量和语义转变:源域和目标域的成像条件不同,而目标域包含训练中缺少的多种攻击类型。现有的基于提示的方法通常通过类别语义或语言指导来表达欺骗,这对于建模高级概念很有效,但不太适合明确捕获未见过的攻击的不断演变的细粒度和空间异构取证证据。受许多看不见的攻击可以通过重复出现的视觉线索的新组合来表征的假设的启发,我们提出了一种完全在视觉特征空间中运行的组合取证视觉提示学习框架。该框架建立在基于 ViT 的冻结视觉基础模型之上,采用补丁感知注意力将一组共享的可学习微取证基元细化为从图像补丁派生的局部取证证据单元。然后,特定于类的全局上下文提示提供依赖于输入的路由权重,自适应地选择这些基元并将这些原语组合成组合取证视觉提示,以进行真实/欺骗区分。原语没有被赋予预定义的语义;相反,它们的专业化和重用来自于跨类别的共享参数化和联合优化。对九个开放世界协议的广泛实验展示了最先进的性能、强大的跨域泛化能力以及对未见过的攻击的强大适应能力。