论文
EmoMind:从人脑功能磁共振成像中解码情感描述
EmoMind: Decoding Affective Captions from Human Brain fMRI
摘要
从大脑活动中解码视觉体验已经取得了长足的进步,但当前的大脑到文本的系统在很大程度上恢复了语义内容,同时丢弃了情感。此外,当使用分类标签提示时,语言模型可以生成情感文本,但此类标签将丰富的主体间变异性分解为粗糙的离散箱。我们推出了 EmoMind,这是第一个直接从功能磁共振成像信号解码情感字幕的端到端管道。 EmoMind 首先从大脑解码的视觉特征中检索基于语义的中性场景描述,然后使用从同一功能磁共振成像记录中解码的连续 34 维情感向量重写它。为了控制内容保留和情感表达之间的平衡,我们使用无分类器的指导来针对身份保留的空分支来训练重写器,从而实现语义保真度和情感表达之间的平滑插值。我们使用涵盖主题特异性、结构几何和因果控制的三轴验证框架来评估情感标题的生成。我们通过合成大脑替代测试进一步增强了这个框架,该测试可探测测量设备的稳健性,并且我们将每个轴与 GPT-4 进行基准测试,并以大脑解码的前 5 种情绪标签作为强大的离散基线。在两个独立的情感 fMRI 数据集中,EmoMind 在所有三个轴上都显着优于标签提示的 GPT-4,在需要特定于人的情感结构而不是群体水平的情感聚合的指标上获得最大的收益。这些结果将连续的大脑解码情感建立为个性化情感字幕生成的可行控制信号,并为研究个体情感大脑组织开辟了新的方向。