论文
你能相信你所看到的吗?人工和人工智能对合成法律证据的检测
Can You Trust What You See? Human and AI Detection of Synthetic Legal Evidence
摘要
视觉证据长期以来一直被视为一种可靠的法律证明形式,但人工智能 (AI) 的进步正在破坏这一假设。本文探讨了在以物体为中心的民事纠纷典型场景中,人类和前沿多模式 大语言模型 (MLLM) 能够如何区分真实的证据照片和人工智能生成的对应物。我们构建了合成法律证据检测 (SLED-1400),这是一个包含 200 个真实证据图像的数据集,与 1,200 个合成对应物配对,由 6 个当代文本到图像生成器生成,涉及 10 个证据类别。在由 136 名非专业参与者参与的受控网络实验以及对四个 MLLM(GPT-5.1、Gemini-3-Pro、Gemini-3-Flash、Qwen3-VL-235B)的标准化评估中使用了相同的刺激和响应格式。人类的总体准确度为 64.8%,在两个最强的生成器(Gemini-3-Pro-Image 和 Flux-2-Max)上的准确度分别为 48.5% 和 51.0%,与偶然结果没有区别。 MLLM 从未对真实图像进行错误分类(100% 特异性),但错过了来自较难生成器的大多数合成输出,Gemini-3-Pro-Image 输出上的平均 MLLM 检测率为 5.9%。人为错误和 MLLM 错误在很大程度上不相关,而四个 MLLM 彼此之间密切相关。这两个组都不是可靠的独立验证器。我们认为,法律诉讼中的视觉证据应该被视为本质上有争议的,并且可行的程序响应必须结合训练有素的人工审查、MLLM 筛选和来源基础设施(例如 C2PA 内容凭证)。