论文
未来的视频生成比观察到的视频更符合人类视觉皮层
Future Video Generation Better Aligns with the Human Visual Cortex than Observed Video
摘要
研究视觉模型的内部表示和视觉皮层对相同观察到的视觉刺激的反应之间的一致性使我们能够更好地理解人类视觉处理。然而,迄今为止的研究在很大程度上忽视了这样一个事实:人脑不仅处理观察到的视觉刺激,而且还根据观察到的内容预测即将到来的刺激。因此,我们假设用于生成未来视频帧的内部表示比观察到的视频本身的表示更符合人类视觉处理的预测性质。为此,我们比较了人类观看视频时视觉皮层的 fMRI 反应与两种视频扩散模型(自回归 (AR) 模型及其非 AR 基础模型)的内部表示之间的一致性。我们首先对 AR 视频扩散模型进行模型内分析,结果表明,与观察到的视频的表示相比,未来视频生成的表示与视觉皮层的一致性更好。然后,我们将 AR 模型的内部表示与其非 AR 基础模型的内部表示进行比较,并再次表明,与基础模型观察到的视频重建的表示相比,未来视频生成的表示与视觉皮层更加一致。具体来说,观察到的视频重建的对齐集中在低阶视觉皮层,而未来视频生成的对齐集中在高阶视觉皮层。最后,我们在人类行为实验中表明,人类更喜欢通过放大与视觉皮层更好地对齐的各个层的贡献而生成的视频。