论文
大脑看到什么?多视图神经表征揭开了大脑视觉对齐的神秘面纱
What Does the Brain See? Multiview Neural Representations to Demystify the Brain-Visual Alignment
摘要
脑电图(EEG)的零样本视觉解码旨在从非侵入性神经记录中推断视觉语义,但由于脑电图的信噪比低、非平稳性和空间分辨率有限,仍然具有挑战性。现有的脑电图视觉对齐方法通常依赖于整体脑电图嵌入,这可能会掩盖视觉感知背后的互补时间、光谱和空间结构。我们引入了一个统一的多视图脑电图表示学习框架,用于将大脑反应与视觉语义嵌入对齐。我们的方法构建了一个脑电图编码器,它联合建模了三个互补视图:输入条件状态空间时间动力学、用于样本自适应频率建模的可学习小波谱分解以及用于结构化电极交互的注意力调制图学习。使用对比学习和脑电图特定正则化,将所得的多视图脑电图嵌入与共享语义空间中的预训练视觉表示融合并对齐,从而实现 200 路零样本视觉分类。 THINGS-EEG 基准测试表明,我们的方法实现了最先进的性能,在受试者内设置中具有 54.8% Top-1 和 85.6% Top-5 准确率,在跨受试者设置中具有 15.3% Top-1 和 45.4% Top-5 准确率。我们进一步提出了第一个系统的跨会话脑电图图像解码评估,实现了 40.8% Top-1 和 78.0% Top-5 的准确率。这些结果表明,显式建模多视图神经结构可以改善基于脑电图的视觉解码中的语义对齐和泛化。