论文

Mandela-Bench:熟悉图像的记忆可能干扰VLM核验编辑

Mandela-Bench: Multimodal Models Remember Canonical Images Instead of Seeing Them

模型评测鲁棒性、公平性与可信度评测

摘要

现在可以使用一条指令无缝编辑历史照片和其他规范图像,通常不会留下可靠的像素级痕迹。在这种情况下,操纵的唯一证据可能是图像所描绘内容的事实。相反,现有的基准依赖于生成器伪影、图像标题不一致、视觉不可信或外部参考,因此不会测试模型是否可以使用自己的世界知识来验证已识别的图像。我们介绍了 Mandela-Bench,其中包含 1,507 个对规范图像的编辑:1,359 个纯知识伪造,每一个都与一个可验证的事实相矛盾,以及 148 个无锚控件(保留编辑过程而不引入事实矛盾),以及 474 个未受影响的原始图像。我们不仅对模型是否检测到伪造进行评分,还对其解释是否识别了插入的实体或被违反的事实进行评分。在 36 个多模态模型中,从 0.8B 参数到前沿尺度,我们发现了一致的失效模式。当某个公众人物从熟悉的照片中消失时,高达 72.7% 的模型仍然会提到该人的名字。一些模型可以在单独显示时区分替换脸部和原始脸部,但仍然判断完整编辑的照片是真实的。提供真实的事件和日期并不能改善基于知识的检测,而在裁剪掉可识别的成分后提供相同的信息却可以改善。即使在明确的验证提示下,36 个模型中也只有一个模型在至少一半的伪造图像上满足 KGR 标准。这些结果表明,失败不能仅用知识缺失或认知不足来解释。相反,它们与识别偏差验证一致,偏向于记忆的规范图像而不是观察到的编辑。