论文
EEG基础模型从人类大脑信号中捕获了什么?
What Do EEG Foundation Models Capture from Human Brain Signals?
摘要
临床脑电图(EEG)分析建立在数十年来不断打磨的手工特征目录之上,例如频带功率、连通性、复杂度等。现代EEG基础模型绕过这套目录,通过自监督预训练直接从原始信号学习,并在大多数临床基准上追平或超越特征工程基线。这两种表征是否对齐是一个开放问题,我们将其分解为三个子问题:模型学到了什么、模型使用了什么、以及有多少可以被解释。我们用逐层ridge探测、LEACE式交叉协方差子空间擦除以及一个以随机特征基线为对照的透明分类器来回答这些问题。该审计覆盖三个基础模型(CSBrain、CBraMod、LaBraM)、五项临床任务(MDD、Stress、ISRUC-Sleep、TUSL、Siena)以及一个6大类63项特征的词汇表。在$945$个(模型、任务、特征)单元中,$648$个($68.6\%$)是表征因果性的,$199$个($21.1\%$)仅为编码性的。跨任务来看,$50$个特征可视为通用候选,它们在两个或更多任务中获得强支持(三种架构均为RC)。频域特征占主导,但其余五大类各自也贡献了可观的因果质量。被确认的特征平均可恢复基础模型相对随机基线优势的$79.3\%$,并呈现清晰的任务梯度(MDD $\approx 0.99$降至Stress $\approx 0.56$):接近天花板的任务几乎被特征词汇表完全恢复,而更难的任务则留下不可忽略的残差,为未来的概念发现指明了具体目标。
