论文

脑微结构预训练:分开样本数、来源多样性与空间覆盖

Samples, Sources, Space: Decomposing Data Scale in Spatially Structured Representation Learning of Human Brain Microarchitecture

模型训练预训练

摘要

规模研究通常通过单个样本计数来表示训练数据。然而,对于层次结构和空间结构化数据,可以从少数或许多来源提取相同数量的样本,并在底层域中以不同的方式分布。因此,我们将数据缩放作为分配问题进行研究,将独特的样本计数、来源多样性和空间覆盖范围分开。我们在微观全脑组织学中研究这种分解,其中源是单个大脑,样本是特定空间位置的图像块。在使用空间邻近性进行监督的对比模型的 93 次受控预训练运行中,我们改变了来自 21 个人脑的 1160 万个空间锚定图像块的数据分配、计算和模型容量。通过更多独特的样本、更广泛的空间覆盖范围、额外的计算和更大的模型容量来提高性能。在固定样本数量下,将样本分布在 1 到 18 个受试者中不会产生可检测到的改进,尽管表征对于预训练期间遇到的受试者具有更好的泛化性。因此,受试者间的变异会强烈影响泛化,但当固定样本预算分布在更多来源时,额外的受试者不会带来任何好处。这些结果将样本计数、来源多样性和空间覆盖范围确立为空间结构化表示学习中数据缩放的不同轴。

脑组织学预训练实验分开改变样本数、来源数量、空间覆盖、计算和模型容量。
图1(图注摘要):脑组织学预训练实验分开改变样本数、来源数量、空间覆盖、计算和模型容量。