论文

可视化不可见之物:生成式视觉依据对齐赋能MLLM的通用EEG理解

Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

模型训练监督微调与指令调优

摘要

利用预训练LLM和MLLM的通用表征,为构建脑基础模型提供了一条有前景的路径。然而,视觉诱发的EEG数据集仍然稀缺,导致现有方法主要将神经信号与抽象文本对齐,这是一种有损翻译,可能丢弃脑活动中编码的细粒度感知信息。我们提出生成式视觉接地(GVG),一个通过EEG到图像生成模型充当视觉翻译器来使不可见之物可视化的框架。GVG不再强迫EEG仅转为文本,而是为非视觉EEG生成实例特定的代理图像,提供结构化的视觉上下文,使MLLM能够利用其视觉先验进行临床状态解读。我们在两个MLLM骨干上验证了这一想法:GVG-X-Omni和GVG-Janus。仅图像对齐已具竞争力:轻量级GVG-X-Omni在冻结的7B骨干上仅微调170M参数,即可媲美1.7B参数的文本对齐基线。我们进一步将GVG-Janus扩展为图像+文本三模态对齐,其中文本提供类别语义锚点,视觉代理以感知细节丰富神经表征。实验显示EEG理解与视觉生成均取得一致提升,表明视觉代理接地是文本对齐的有效补充。

可视化不可见之物:生成式视觉接地赋能MLLM的通用EEG理解:论文配图
(a) GVG的核心思想。 EEG 被翻译成类似视觉的语言,以便 MLLM 可以更好地利用其本地视觉先验解释神经动力学。(b) AVDE 的训练和生成(Dai 等人,2026)。对于没有配对视觉刺激的 EEG 数据集,AVDE 生成特定于实例的代理图像以提供视觉基础。图 1.我们的核心思想和代理图像策略概述。左图:GVG 将 EEG 转换为类似视觉的语言,使 MLLM 能够利用丰富的视觉先验来理解神经信号。右:对于非视觉临床数据集,AVDE 合成代理图像,桥接缺失的视觉模态并启用相同的视觉基础管道。两面板概述图。左图说明了将 EEG 转换为 MLLM 的类似视觉语言的核心思想。右侧面板显示 AVDE 为非视觉数据集生成代理图像,以便可以应用相同的视觉基础框架。