论文
DINOv3 击败专用探测器:图像取证的简单基础模型基线
DINOv3 Beats Specialized Detectors: A Simple Foundation Model Baseline for Image Forensics
摘要
随着深度生成模型的快速发展,逼真的假图像变得越来越容易获得,但现有的定位方法依赖于复杂的设计,并且仍然难以在操作类型和成像条件下进行泛化。我们提出了一个基于 DINOv3 的简单但强大的基线,具有 LoRA 适配和轻量级卷积解码器。在 CAT-Net 协议下,我们的最佳模型在四个标准基准上仅使用 9.1\,M 个可训练参数,在冻结的 ViT-L 主干上将平均像素级 F1 比之前的最新技术提高了 17.0 个点,甚至我们最小的变体也超越了所有先前的专用方法。 LoRA 在所有主干规模上始终优于完整的 微调。在数据稀缺的 MVSS-Net 协议下,LoRA 的平均 F1 为 0.774,而最强的先验方法为 0.530,而完整的 微调 变得高度不稳定,这表明预训练的表示形式编码的取证信息可以更好地保存而不是覆盖。该基线还对高斯噪声、JPEG 重新压缩和高斯模糊表现出很强的鲁棒性。我们希望这项工作能够成为研究界的可靠基线和未来图像取证应用的实际起点。代码可在 https://github.com/Irennnne/DINOv3-IML 获取。