论文

EEG基础模型从人类大脑信号中捕获了什么?

What Do EEG Foundation Models Capture from Human Brain Signals?

模型评测模型行为与机制分析

摘要

临床脑电图(EEG)分析建立在数十年来不断打磨的手工特征目录之上,例如频带功率、连通性、复杂度等。现代EEG基础模型绕过这套目录,通过自监督预训练直接从原始信号学习,并在大多数临床基准上追平或超越特征工程基线。这两种表征是否对齐是一个开放问题,我们将其分解为三个子问题:模型学到了什么、模型使用了什么、以及有多少可以被解释。我们用逐层ridge探测、LEACE式交叉协方差子空间擦除以及一个以随机特征基线为对照的透明分类器来回答这些问题。该审计覆盖三个基础模型(CSBrain、CBraMod、LaBraM)、五项临床任务(MDD、Stress、ISRUC-Sleep、TUSL、Siena)以及一个6大类63项特征的词汇表。在$945$个(模型、任务、特征)单元中,$648$个($68.6\%$)是表征因果性的,$199$个($21.1\%$)仅为编码性的。跨任务来看,$50$个特征可视为通用候选,它们在两个或更多任务中获得强支持(三种架构均为RC)。频域特征占主导,但其余五大类各自也贡献了可观的因果质量。被确认的特征平均可恢复基础模型相对随机基线优势的$79.3\%$,并呈现清晰的任务梯度(MDD $\approx 0.99$降至Stress $\approx 0.56$):接近天花板的任务几乎被特征词汇表完全恢复,而更难的任务则留下不可忽略的残差,为未来的概念发现指明了具体目标。

EEG基础模型从人类大脑信号中捕获了什么?:论文配图
图 1:三问题审核概述。 (a) 审核目标为手工制作的 6 个族 6363 个特征的脑电图词典;对于三个基础模型和五个临床任务(总共 945945 个单元)中的每个(数据集、模型、特征)三元组,我们运行 Probe、Erase(LEACE 式交叉协方差子空间擦除)和 Closure。 (b) 所有 945945 个单元的家庭聚合学习与使用率:外环被编码(约 90%\约 90%),内环被因果使用(约 69%\约 69%)。 (c) 针对同维随机特征基线的每(任务、模型)闭合率;闭包遵循一个干净的 MDD-to-Stress 任务梯度。