论文
GPT-Image-2 实际应用:部署第一周自我报告的人工智能生成图像的 Twitter 数据集
GPT-Image-2 in the Wild: A Twitter Dataset of Self-Reported AI-Generated Images from the First Week of Deployment
摘要
OpenAI 发布的 GPT-image-2 标志着人工智能生成图像的分水岭:摄影现实和合成内容之间的界限从未如此难以辨别。我们引入了 GPT-Image-2 Twitter 数据集,这是第一个发布的 GPT-image-2 生成图像的数据集,源自该模型于 2026 年 4 月 21 日发布后立即公开的 Twitter/X 帖子。利用 Twitter API v2 和涵盖多语言文本启发式(英语、日语和中文)的多阶段管理管道、浏览器自动 Twitter“Made with AI”徽章验证以及模型名称变体匹配,我们在六天内从 27,662 个收集的记录中管理了 10,217 个已确认的 GPT-image-2 图像。我们通过四项分析来表征数据集:基于 CLIP 的零样本主题分类、OCR 文本易读性(82.0% 的图像包含可检测文本)、人脸检测(59.2% 的图像,总共 22,583 个人脸)和语义聚类(137 个 CLIP ViT-L/14 聚类)。一个关键的负面结果是,C2PA 内容凭证在上传时被 Twitter 的 CDN 系统性地剥离,导致社交媒体来源的 AI 图像的加密来源验证变得不可行。数据集和所有管理代码均公开发布。