论文

EditSleuth:带有视觉证据推理链的图像编辑取证数据集

EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics

模型评测基准与评测资源

摘要

对人工智能编辑图像的取证分析需要的不仅仅是二元真假预测:一个有用的系统应该定位编辑,识别其语义类型,并根据视觉证据做出决策。现有的图像取证数据集通常强调检测或定位,而推理监督视觉语言数据集很少以图像处理为目标,并且通常依赖于 LLM 生成的基本原理,而 忠实性 很难验证。我们引入了 EditSleuth,这是一个由 257,725 个图像编辑三元组组成的数据集,由现有图像编辑语料库构建,用于基础图像编辑取证推理。每个示例都包含一个编辑后的图像、其源图像、一个二进制编辑掩码、一个 12 类编辑分类标签、一个难度分数和一个六步推理链。 EditSleuth 链是根据三元组上游工件确定性生成的,每个语句都与特定的可计算证据来源相关联。我们的分析表明,简单的四分量难度公式会遭受幅度特征之间的 2 级相关性崩溃;简化的三组分配方大大增加了 Pico-Banana 和 MagicBrush 的分数分散度。大多数编辑类别中的难度也存在显着差异,这表明分数并不能代表编辑类型。作为一项初始学习研究,我们使用 LoRA 微调 Qwen2-VL-2B,发现链作为目标监督与可解析答案中的分类准确性的仅标签基线相匹配,同时还产生了仅标签监督无法产生的具有视觉依据的文字解释。我们发布数据集、确定性构建管道和飞行员训练脚本。