论文

GPT4o-Receipt:面向AI生成文档取证的数据集与人类研究

GPT4o-Receipt: A Dataset and Human Study for AI-Generated Document Forensics

模型评测基准与评测资源

摘要

人类能比机器更好地识别AI生成的金融文件吗?我们提出GPT4o-Receipt,一个包含1,235张收据图像的基准,将GPT-4o生成的收据与来自既有数据集的真实收据配对,由五个最先进的多模态LLM和一项30名标注者的众包感知研究进行评估。我们的发现揭示了一个惊人的悖论:人类更善于看出AI痕迹,却更不善于检出AI文件。人类标注者表现出所有评估者中最大的视觉判别差距,但其二分类检测F1远低于Claude Sonnet 4,也低于Gemini 2.5 Flash。一旦理解其机制,这一悖论便迎刃而解:AI生成收据中的主导取证信号是算术错误——视觉检查不可见,但LLM可以系统性地验证。人类无法察觉一个小计金额不正确;LLM能在毫秒内完成验证。在人类与LLM对比之外,我们的五模型评估还揭示了显著的性能差异与校准差异,使得简单的准确率指标不足以支撑检测器选型。GPT4o-Receipt数据集、评估框架与全部结果均已公开发布,以支持未来的AI文档取证研究。

GPT4o-Receipt:面向AI生成文档取证的数据集与人类研究:论文配图
图 4:由每个检测器模型评估的人工智能生成的收据中每个错误类别的故障率 (%)。深红色表示故障率较高。 LLaMA 4 Scout 的错误检测率接近于零,这与其识别 AI 生成的收据的整体失败相符。