临床脑电图基础模型基准的阴性对照协议:数据集身份和外部队列压力测试
A Negative-Control Protocol for Clinical EEG Foundation-Model Benchmarks: Dataset Identity and External-Cohort Stress Testing
摘要
脑电图基础模型增益可能取决于队列、蒙太奇或探头设计。我们在存在标识符的情况下使用主题不相交验证,评估了跨四个基准数据集以及韩国 CAUEEG 的五项任务的五个模型。 CAUEEG 是记录级别,具有带注释的无重叠保留灵敏度。在匹配的 CAUEEG 正常/轻度认知障碍/痴呆分类(1,187 个记录)中,经典特征达到 0.734 宏观 AUROC(增强敏感性:0.736),而 BIOT-bipolar16 0.677、CBraMod 0.669 和 REVE 0.568。带注释的无重叠保留子集保留了经典的 REVE 排序(0.717 与 0.565)。所有五个编码器在折叠 PCA-50 之前和之后都以 1.000 解码数据集身份;标签排列崩溃为机会,平衡子样本保持在 1.000。这建立了数据集成员资格,而不是因果地点、地理或人口效应。匹配的完全随机初始化的编码器在 CAUEEG 上的描述性高于预训练的 REVE(0.667 与 0.570),并且正确与加扰源标签 LoRA 运行在不匹配的描述性敏感性(而不是标签效应估计或等价性测试)中产生了数值上相似的 AUROC。在 CHB-MIT 跨受试者发作检测中,REVE 达到 0.793 AUROC,而最佳测试的增强型非线性比较器为 0.739,完全随机初始化为 0.691,原始信号随机特征为 0.505。配对的 REVE 负增强比较器差异为 +5.38 个百分点(95% CI -0.36 至 +11.22),因此比较器的优越性仍未解决;幅度感知比较器也无法从保留的归一化输入中重建。我们将蒙太奇匹配、患者重叠检查、更强的比较器和表征控制提炼成临床脑电图基础模型研究的报告协议。