论文
可视化不可见之物:生成式视觉依据对齐赋能MLLM的通用EEG理解
Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs
摘要
利用预训练LLM和MLLM的通用表征,为构建脑基础模型提供了一条有前景的路径。然而,视觉诱发的EEG数据集仍然稀缺,导致现有方法主要将神经信号与抽象文本对齐,这是一种有损翻译,可能丢弃脑活动中编码的细粒度感知信息。我们提出生成式视觉接地(GVG),一个通过EEG到图像生成模型充当视觉翻译器来使不可见之物可视化的框架。GVG不再强迫EEG仅转为文本,而是为非视觉EEG生成实例特定的代理图像,提供结构化的视觉上下文,使MLLM能够利用其视觉先验进行临床状态解读。我们在两个MLLM骨干上验证了这一想法:GVG-X-Omni和GVG-Janus。仅图像对齐已具竞争力:轻量级GVG-X-Omni在冻结的7B骨干上仅微调170M参数,即可媲美1.7B参数的文本对齐基线。我们进一步将GVG-Janus扩展为图像+文本三模态对齐,其中文本提供类别语义锚点,视觉代理以感知细节丰富神经表征。实验显示EEG理解与视觉生成均取得一致提升,表明视觉代理接地是文本对齐的有效补充。
