论文
BraVista:以视觉语言模型统一解码多任务脑电信号
Multimodal LLMs Can Learn to Read Brain Signals: A Vision--Language Model for Unified Multi-Task EEG Decoding
摘要
学习泛化认知任务、受试者和记录条件的脑电图表征仍然是脑电图 (EEG) 解码中的一个关键挑战。基础模型的最新进展提高了脑电图解码性能,但仍然存在一个基本的悬而未决的问题:如何有效地将神经信号与这些模型连接起来,以实现跨数据集的多任务学习。为了研究这个问题,我们引入了 BraVista,这是一种视觉语言框架,它将多通道 EEG 信号编码为结构化图像,并通过指令条件视觉语言模型 (VLM) 实现多任务学习。我们的方法依赖于通用域 VLM 的持续后训练,利用其视觉和语言先验来适应神经信号,而无需单独的大规模脑电图特定预训练阶段。我们在涵盖睡眠分期、情绪识别、认知工作量分类和异常脑电图检测的四个数据集上评估了 BraVista,在这些任务中显示出强大的性能。进一步的分析表明,脑电图到图像表示的选择对于性能至关重要。此外,通过控制脑电图信号的扰动,我们观察到在噪声增加的情况下性能逐渐下降,这表明该模型依赖于脑电图相关信息而不是表面视觉模式。这些发现共同建立了结构化视觉表示,作为神经信号和通用域基础模型之间的有效且可扩展的接口,用于统一多任务脑电图解码。
