论文

视觉目标很重要:跨视觉层次学习脑到图像检索

The Visual Target Matters: Learning across the Visual Hierarchy for Brain-to-Image Retrieval

模型训练监督微调与指令调优

摘要

大脑到图像检索旨在识别引起非侵入性神经反应的视觉刺激。候选图像通常由预训练的视觉模型表示,其内部表示在不同深度的抽象上有所不同。现有方法通常训练神经编码器来恢复固定的最终层视觉目标。在这种表述下,视觉层次结构被简化为单个指定端点,从而防止其他深度的表示直接塑造视觉目标。这种限制促使人们学习跨视觉深度的信息如何有助于检索目标。为此,我们引入了 NeuroGlyph,它从冻结视觉主干的多个深度学习独立于试验的视觉目标。 NeuroGlyph 将目标分解为特定因子的子空间。每个子空间都会学习视觉深度上的图像条件分配。得到的子空间被融合成单个嵌入以供检索。在 THINGS-EEG 和 THINGS-MEG 中,NeuroGlyph 在所有受控比较中都优于最终层监督。它还在四项比较中的三项中超越了事后最佳固定层预言机。参数匹配的消融支持分解目标构建和图像条件深度分配。在类似的 200 路检索协议下,NeuroGlyph 在八个报告指标中的六个中实现了最强的系统级性能。这些结果支持跨视觉层次结构的学习检索目标,而不是规定一种视觉深度。