论文
图像到图像生成模型的视觉编码器行为指纹:六种商业 API 的训练范式驱动分类法
Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs
摘要
我们在内容自适应 sub-JND 对抗扰动管道下研究了六个生产图像到图像 AI 系统(gpt-image-1、Gemini 2.5 Flash Image、Flux Kontext、SDXL img2img、SD3 img2img 和 Qwen Image Edit),通过冻结 DINOv2 ViT-B/14 词元距离与干净参考对所有输出进行评分。在涵盖 COCO 照片、CelebA-HQ 肖像和 AI 生成输入的 3,588 个调用语料库中,这六个系统在 2D(patch_mean、ssim_clean)平面上划分为两个图像不变的行为带:经过编辑训练的模型(Flux Kontext、Qwen Edit、Gemini)集群在紧密带中,而基于 T2I 的模型在采样时间进行调整(SDXL、SD3、gpt-image-1)集群在漂移带中。