论文

fMRI 基础模型的规模化研究

A Scaling Study for fMRI Foundation Models

模型评测模型能力评测

摘要

缩放定律指导了计算机视觉和自然语言处理领域的大型模型开发,但功能磁共振成像 (fMRI) 基础模型的数据、模型大小和计算之间的关系仍不清楚。在这里,我们使用来自 200 多个源数据集的预训练数据和超过 10,000 个 GPU 小时的实验进行了受控实证研究。保持预训练框架和下游协议固定,我们改变预训练数据大小、模型大小和训练持续时间。下游性能通常会随着计算而提高,但使用类似计算的模型的性能可能会大不相同。额外的预训练数据会在较大的模型尺寸上带来更大的收益,这表明数据和模型尺寸应该一起缩放。在匹配计算中,增加预训练数据比增加模型大小更有利于更多任务,尽管不同任务的模式有所不同。然后,我们使用分布内 (ID) 下游性能来选择两个固定计算预算下的预训练数据大小、模型大小和训练持续时间的组合。生成的模型在分布外 (OOD) 评估之前被锁定。在比较的 fMRI 基础模型中,它们在评估的 OOD 任务中实现了最高的平均性能,同时使用较少的预训练计算。总的来说,我们的结果表明,计算本身并不能表征 fMRI 缩放:性能取决于预训练数据、模型大小和训练持续时间的组合方式。