论文

经TRIBE v2数据增广增强脑到图像解码

Boosting Brain-to-Image Decoding with TRIBE v2 Data Augmentation

模型训练合成数据

摘要

大脑解码受到标记神经数据可用性的限制,并且在低数据情况下仍然具有挑战性。为了解决这个问题,我们研究是否以及何时可以通过使用预训练的 fMRI 对刺激反应的模型生成的合成数据来增强小型 fMRI 数据集来增强大脑解码。我们使用 TRIBE v2,这是一种大型编码模型,经过 1000 多个小时的 fMRI 对视频、音频和语言响应的预训练。对于每个数据集,我们评估系统网格,显示图像解码器的性能如何随着用于训练的合成数据量的变化而变化。我们的结果基于两个数据集(7T fMRI 自然场景数据集和 3T fMRI BOLD5000),显示与仅在真实数据上训练的解码器相比,Top-10 图像检索精度提高了 68%。重要的是,达到给定图像解码性能所需的增强数据的比例需要根据数据源进行调整。令人惊讶的是,专门针对合成 fMRI 进行训练的图像解码器在某些设置中的表现可以高于预期,这表明 TRIBE v2 可以支持零样本脑到图像解码。总之,这些结果表明功能磁共振成像对视觉、声音和语言响应的大规模模型如何为提高图像解码的数据效率提供基础。

经TRIBE v2数据增广增强脑到图像解码:论文配图
图 1:TRIBE v2 图像条件 fMRI 增强协议。图 2:DINOv2 小图像嵌入预测皮质 fMRI 反应。图 3:TRIBE v2 图像条件 fMRI 增强和目标嵌入神经信号。 (a) 对于每个受试者和数据集,我们保留 p​NpN 真实图像-fMRI 训练对,并采样该受试者未见过的其他 COCO 图像。 TRIBE v2 预测对这些图像的合成 fMRI 响应,产生 pNapN 合成训练对,其中 aa 是增强因子。我们在真实和合成对的混合结果上训练 fMRI-to-DINOv2-small 解码器,并仅使用 Top-10 图像检索在保留的真实 fMRI 上对其进行评估。 (b) 大脑编码网格显示 DINOv2-small-预测与 fsaverage5 上真实 fMRI 皮层激活之间的皮尔逊相关性,对每个数据集中的受试者进行平均,支持使用 DINOv2-small 作为解码图像表示。