论文
从“假设”到“是什么”:反事实思维启发的视觉大脑解码语义对齐
From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding
摘要
视觉大脑解码通过功能磁共振成像等神经测量重建人感知的视觉内容,为研究视觉信息如何在大脑中表示提供了一种计算方法。最近的多模态表示和扩散先验提高了重建的真实性。然而,视觉上合理的重建可能包含不正确的对象、属性或关系,因为强生成先验可以完成解码表示未充分指定的内容。传统的重建指标主要评估最终图像,因此可能掩盖此类语义错误。我们提出了 ConceptAlign,一种用于视觉大脑解码的反事实语义对齐框架。 ConceptAlign 汇集解码后的视觉标记,并将它们投影到冻结的文本嵌入空间中,将表示与 真值 标题对齐,同时将其与保留场景的几乎未命中的替代方案分开。这些替代方案由 LLM 离线生成,可在保留场景的同时修改一个关键对象、属性或关系。基于边缘的目标可以学习观察到的刺激与看似合理但不正确的解释之间的细粒度语义边界,而无需在推理过程中调用 LLM。我们引入了一个系统的三级语义评估框架,涵盖基础辨别性、反事实描述辨别力和表征几何。自然场景数据集上的实验表明,ConceptAlign 改进了 MindEye2 主干上的重建措施、反事实语义辨别和表征对齐。匹配的负源消融、独立的 LLM 和人工编写的替代方案以及人工评估支持监督的有效性和鲁棒性,在细粒度冲突、有限数据解码和跨主体结构方面具有有利的模式。