论文

多少 MRI 预处理就足够了?脑 MRI 基础模型的成本效用研究

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models

模型训练预训练

摘要

MRI 预处理定义了脑 MRI 基础模型所看到的输入分布,但它通常被视为常规数据清理而不是建模选择。我们询问对于自监督 3D MRI 预训练来说,多少预处理值得其计算成本。保持语料库、3D ViT 主干、掩蔽协议和下游评估固定,我们在 20,000 个异质脑 MRI 体积上比较掩蔽自动编码 (MAE) 和联合嵌入预测学习 (JEPA) 的分级 P0-P7 预处理谱,然后将编码器转移到 IDH 预测、MCI 分类、脑年龄回归和 GLI/PED 肿瘤分割。结果不支持简单的“越多越好”规则。 P0/P1 在数值上不稳定,使得 P2 成为成本最低的可行水平;除了 P2 之外,选择最佳可行的预处理水平仅使 MAE 的总效用提高了 3.4 个百分点,对 JEPA 的总效用提高了 1.8 个百分点,而且大多数配对收益在统计上尚未解决。更强的预处理仅在选定的方案中有益:IDH 略有改善,AGE 和 GLI/PED 通常接近或最好处于 P2,MCI 显示出最清晰的经验 P7 增益。跨级 MCI 迁移进一步表明,可以通过在下游应用更强的预处理来恢复 P7 的大部分优势,而无需在整个预训练过程中使用 P7。这些发现将 MRI 预处理重新定义为下游感知的成本效用决策,而不是默认的升级管道。代码可在 https://github.com/PangJiangShuan/PreBrain 获取。