论文

IMFD:通过基于指令的大型视觉语言模型进行端到端多脸伪造检测

IMFD: End-to-end Multi-Face Forgery Detection through Instruction-based Large Vision-Language Models

上下文与知识上下文工程

摘要

由于深度造假在社交媒体上的传播,其迅速增加引起了人们的严重关注。传统的多脸伪造检测器独立裁剪和验证每张脸,忽略背景上下文和人脸界面关系,这通常会产生次优的性能。为了克服这些限制,我们利用基于指令的大型视觉语言模型(LVLM),它可以解释整个图像并遵循复杂的文本指令。我们提出了一种简单而有效的单级多脸伪造检测器,称为IMFD(基于指令的多脸伪造检测器),它经过端到端训练以联合定位面部并预测每个面部的伪造标签。 IMFD 并没有将人脸框预测仅视为联合目标,而是明确地将预测的人脸边界框作为视觉提示集成到指令中,以增强指令基础和伪造检测。为了支持IMFD的训练和评估,我们将现有的多脸伪造数据集转换为基于指令的格式。实验结果和分析表明,IMFD 通过将人脸边界框集成到指令中来改进多人脸伪造检测,并且始终优于各种最先进的方法。