论文

ChatGPT 图像 2.5 实际应用:发射期数据集和探测器评估

ChatGPT Images 2.5 in the Wild: A Launch-Period Dataset and Detector Evaluation

模型评测基准与评测资源

摘要

图像工具可以更改其底层生成器,同时保留其公共名称,从而使在线帖子的版本归属变得模糊。我们在 ChatGPT Images 2.5 发布后研究这个问题。我们的冷冻收藏包含来自 8 个来源的 2,440 个帖子的 3,478 张图像。记录的发布时间在公告发布后的前 51.1 小时内。它记录三个归因层,并在图像形式过滤和有针对性的审查后保留独立图像。字幕声明和主机记录提供入场证据,而不是独立验证的生成者身份。观察到的内容概况取决于源混合物:NightCafe 提供 39.0% 的图像,但提供 77.0% 的 CLIP 分配的幻想场景。然后,我们在参考照片上校准到 5% 标记率的阈值下评估六个冻结探测器。收集标记率范围为 3.7% 至 56.4%,比 GenImage 召回率低 42-81 个百分点。保留的艺术品误报率范围为 1.5% 至 96.5%,因此较高的收藏标记率本身并不能建立更好的检测。与我们 4 月集合进行的探索性仅 X 比较发现,在固定阈值后集群引导间隔下,Effort 的 9 月标记率较高,DoU 也存在暗示性差异。归因、内容和处理差异阻碍了对这些对比的因果解释。该集合支持对产品过渡期间报告的模型使用进行分析,并保留来源和归因证据以供解释。