论文

关于 CLIP 嵌入空间中人类和人工智能生成图像的分离

On the Separation of Human and AI-Generated Images in CLIP Embedding Space

模型评测模型行为与机制分析

摘要

我们在 CLIP 表示中发现了一个以前未报告的现象:人类和人工智能生成的绘画沿着其联合嵌入分布的主要方向自发地分离,没有任何旨在区分这两类的监督目标。我们的目标不是利用这种现象进行检测,而是解释它:我们寻求识别分离背后的视觉信息,并将其从嵌入空间追溯到图像域。我们通过将可解释的图像表示与基于梯度的反演相结合的渐进式研究来实现这一目标,系统地用作特征空间中识别的关系的实验探索。鲁棒性实验和日益富有表现力的统计描述符逐渐排除了几种基于全局图像属性和简单局部统计的直观解释,而是指向分布式多尺度图像结构。多尺度散射提供了所考虑的信息最丰富的可解释表示,但仅提供了对该现象的部分解释。直接反演提供了一个互补且引人注目的观察结果:沿主要 CLIP 方向的大量位移可以由图像扰动引起,而人类观察者几乎无法察觉,这表明分离所涉及的方向对图像变化高度敏感,而人类的感知显着性非常低。总而言之,这些结果揭示了 CLIP 表示中反映的视觉证据与人类感知容易获得的视觉证据之间的显着差异,引发了关于人工视觉和人类视觉之间的关系以及最终人工和人类审美判断之间关系的更广泛的问题。