论文
视觉模型像大脑一样看东西吗?脑电图编码模型的比较
Do Vision Model See Like the Brain? A Comparison Across EEG Encoding Model
摘要
卷积神经网络(CNN)和视觉转换器都用于对人类视觉系统进行建模,但是这两种架构是否在网络深度的特定点上存在分歧尚不清楚。我们通过计算每个模型在每一层或块的预测和测量的 EEG 响应之间的皮尔逊相关性 (r) 来比较 6 个 CNN 和两个视觉转换器,十名参与者观看了 200 张自然图像。对于 Transformer 模型,我们还测试了四种词元表示,从单独的分类 (CLS) 词元到与所有补丁词元相结合的 CLS。 CNN 在最早的层表现出最强的对应性,在更深的层则减弱,特别是在刺激后响应的后期。相反,变形金刚在最深的区块上保持着强烈的对应关系,尽管不是在最早的区块上。这一优势取决于词元表示:与保留所有补丁词元的表示相比,合并表示的峰值相关性更弱(r 约为 0.48-0.51)(对于 CLIP-ViT-B/32,r=0.640;对于 DINOv2-ViT-B/14,r=0.656)。受控比较显示,是架构而非训练目标驱动了这种效果:MoCo-v1 和 ResNet-50(匹配架构)的表现几乎相同(r=0.673、0.670),而 CLIP-RN50 和 CLIP-ViT-B/32(匹配目标)则出现分歧,直到保留补丁标记。我们提出 CNN 训练的分类瓶颈会深度压缩大脑相关信息,这与 Transformer 的自注意力和非分类目标不同。空间地形分析显示所有模型都有一个共同的枕骨主导模式,表明这些差异反映了信号强度和持久性,而不是不同的大脑区域。保留补丁的 Transformer 表示在 CNN 崩溃的情况下维持大脑预测对应关系。