论文

BraVista:以视觉语言模型统一解码多任务脑电信号

Multimodal LLMs Can Learn to Read Brain Signals: A Vision--Language Model for Unified Multi-Task EEG Decoding

应用与实践模型训练监督微调与指令调优行业应用通用理解与问答

摘要

学习泛化认知任务、受试者和记录条件的脑电图表征仍然是脑电图 (EEG) 解码中的一个关键挑战。基础模型的最新进展提高了脑电图解码性能,但仍然存在一个基本的悬而未决的问题:如何有效地将神经信号与这些模型连接起来,以实现跨数据集的多任务学习。为了研究这个问题,我们引入了 BraVista,这是一种视觉语言框架,它将多通道 EEG 信号编码为结构化图像,并通过指令条件视觉语言模型 (VLM) 实现多任务学习。我们的方法依赖于通用域 VLM 的持续后训练,利用其视觉和语言先验来适应神经信号,而无需单独的大规模脑电图特定预训练阶段。我们在涵盖睡眠分期、情绪识别、认知工作量分类和异常脑电图检测的四个数据集上评估了 BraVista,在这些任务中显示出强大的性能。进一步的分析表明,脑电图到图像表示的选择对于性能至关重要。此外,通过控制脑电图信号的扰动,我们观察到在噪声增加的情况下性能逐渐下降,这表明该模型依赖于脑电图相关信息而不是表面视觉模式。这些发现共同建立了结构化视觉表示,作为神经信号和通用域基础模型之间的有效且可扩展的接口,用于统一多任务脑电图解码。

BraVista:以视觉语言模型统一解码多任务脑电信号:论文原图
图 1:BraVista 框架。 (a) 将每通道 STFT 频谱图排列成结构化脑电图图像。 (b) 微调视觉编码器处理图像,而任务指令指定数据集、解码目标和有效标签。视觉和文本标记共同决定了采用 LoRA 的语言解码器。