论文

FAS-R1:用于推理人脸反欺骗的统一多任务 MLLM

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

模型训练强化学习

摘要

人们越来越期望面部反欺骗(FAS)不仅可以提供善意/欺骗决策,还可以提供攻击语义和基于图像的证据以供人类检查。现有的判别性 FAS 模型仍然主要以标签为中心,而最近基于 MLLM 的方法提供结构化输出,但仍然主要依赖于监督 微调,通常会生成类似模板的基本原理和针对困难攻击的弱优化。我们提出了 FAS-R1,一种面向两阶段推理的 MLLM 框架,用于统一 FAS 预测,涵盖真实性分类、攻击类型识别和欺骗区域定位。 FAS-R1 首先使用高质量长 CoT 数据集 FAS-R1-23K 进行冷启动监督 微调,然后执行 FAS 特定的 GRPO 后训练。退化模拟增强 (DSA) 鼓励在视觉质量变化过程中进行稳定的欺骗提示推理,而难度感知 GRPO (DA-GRPO) 则可以缓解简单样本的优势,这种优势可能导致困难的任务攻击组优化不足,特别是对于化妆和面具攻击等微妙或模糊的攻击。主3B FAS-R1模型的真实性准确率达到98.75\%,攻击类型准确率达到93.33\%,域内AP@40/AP@50准确率达到96.30/94.73\%。它在跨域真实性泛化以及答案和理由质量方面也优于比较系统。使用不同基础模型的实验进一步显示了良好的缩放行为。该代码即将发布。