论文

去噪模型在跨架构中开发类似人类的感知错觉表示

Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures

模型评测模型行为与机制分析

摘要

研究表明,在自然图像上训练的深度神经网络可以产生与人类观察者一致的亮度错觉输出。虽然这种现象已在各种架构中得到记录,但迄今为止,所有证据都是在输出级别上测量的:恢复的像素、解码的轨迹或分类决策。这些模型是否实际上代表了内部的幻觉,如果是的话,在哪里以及如何代表,仍然未知。我们表明,去噪模型在不同的架构中的特定内部层开发了错觉敏感的表示。具体来说,我们识别了区分虚幻与物理匹配控制区域的层和通道。我们表明,去噪目标是比架构更重要的效果驱动因素。在适合领域的刺激下,这些激活跟踪经过验证的人类亮度感知心理物理模型(FLODOG;Spearman $ρ\geq 0.70$),并随着参数幻觉强度单调缩放。利用这些发现,我们通过通道消融提供因果证据,表明幻觉敏感通道具体且显着地影响内部信号。然而,将这些表示注入生成管道不会在所有测试的架构中产生可测量的像素偏移;我们将这种表征称为感知幻象:在内部处理中活跃,但对任何基于输出的评估都是不可见的。虽然相关的内部输出分离已经在语言模型中得到表征,但这是去噪视觉模型中感知表征的第一个此类表征。