论文
ChatGPT Images 2.5 关于伪造任务:根据已知答案测试广告中的改进
ChatGPT Images 2.5 on Forgery Tasks: Testing Advertised Improvements Against Known Answers
摘要
OpenAI 于 2026 年 9 月 8 日发布了 ChatGPT Images 2.5,宣传更精确的本地编辑、更好的编辑一致性、更忠实的参考产品和更清晰的细节。我们通过四项伪造任务评估这些声明,并预先确定答案:收据字段更改、重复编辑、产品植入和小字体渲染。 GPT-Image-2 以更便宜和更昂贵的级别提供同周基线。收据编辑方面出现有限的改进。对齐后,OCR 在 31.7% 的 Flare 输出中检测到周围文本的变化,而较便宜的基线为 44.2%。这种增益集中在 CORD 接收上,并且对像素或更小的偏移敏感;伪造的价值本身通常不再是正确的。反复编辑和细则显示没有可测量的增益。产品代码变得更加清晰,主要是因为 Images 2.5 将产品绘制得更大。国防成果变化不大:两代人的本土化仍然薄弱。标记 68.6% 受控基准图像的检测器仅标记在线发布图像的 35.9%。因此,广告中的改进并没有均匀地转移到测试的伪造能力上,同时仍然存在很大的检测限制。