论文
AEGIS:评估人工智能生成的学术图像取证分析的整体基准
AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
摘要
我们推出 AEGIS,这是一个评估人工智能生成的学术图像取证分析的整体基准。与现有基准相比,AEGIS 具有三个关键优势:(1)领域特定复杂性:涵盖 7 个学术类别,39 个细粒度子类型,暴露了固有的取证难度,即使 GPT-5.1 也达到了 48.80% 的整体性能,而专家模型仅实现有限的定位精度(IoU 30.09%); (2) 多样化的伪造模拟:在 25 个生成模型中对四种流行的学术伪造策略进行建模,其中 11 个生成的平均取证准确度低于 50%,表明取证学落后于生成的进步; (3) 多维取证评估:联合评估检测、推理和定位,揭示模型系列之间的互补优势,多模态 大语言模型 (MLLM) 在文本工件识别方面的准确率达到 84.74%,专家检测器在二进制真实性检测方面的准确率达到 79.54% 的峰值。通过评估 25 个领先的 MLLM、9 个专家模型以及一个统一的多模态理解和生成模型,AEGIS 作为一个诊断测试台,暴露了学术图像取证的基本局限性。