论文
专家与通才的融合与 Deepfake 检测的结果监督原理
Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection
摘要
可推广的深度伪造检测需要互补的法医和语义视觉证据。专业编码器捕获微妙的操作痕迹,但可能会过度拟合特定源的统计数据,而 MLLM 提供更广泛的视觉语义表示,但可能会忽略精细的取证工件。我们提出了一种两级检测器,其中 MLLM 直接将来自冻结取证编码器的补丁级特征与其本地视觉编码器的特征融合,并自行生成真实性决策。这种专家与通才的结合提供了主要的跨域性能增益。我们随后引入结果监督的基本原理调整。该模型在做出决策之前生成自由形式的视觉原理,并仅使用二进制真实性标签和格式约束进行优化,而不使用特定于任务的原理注释。推理时的基本原理生成是可选的,因此调整后的模型仍然可以返回直接的二进制分数。在 DF40 上,专家与通才的结合将平均跨域 AUC 从 $89.85$ 提高到 $93.32\pm0.44$。在六对配对运行中,基本原理调整获得了 $93.50\pm0.42$ 并改进了六对模型中的五个;平均差异很小,并且没有统计结论。 SID-Set 和遗留基准的结果,以及融合、输出顺序和持续训练控制,证明了互补视觉表示的价值,并表明仅标签基本原理调整可以添加可选的解释模式,同时大致保留直接检测性能。