论文
3D 掩模自动编码器是显微镜体积和多模态细胞表示的强大学习者
3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy
摘要
尽管细胞本质上具有三维性质,但荧光显微镜中的自我监督学习通常依赖于二维投影。我们对体积显微镜数据上的 2D 和 3D 掩模自动编码器(MAE-2D 与 MAE-3D)进行了系统比较。在匹配的架构和训练协议下,MAE-3D 在下游单细胞任务上始终优于 2D 最大投影和基于切片的变体。我们进一步将视觉表示与预训练的蛋白质语言模型(ESM2)结合起来,并表明跨模式监督可以为体积模型带来更大的收益。通道交叉注意力和频域正则化对于利用 3D 空间上下文至关重要。在蛋白质-蛋白质相互作用预测上,我们的最佳模型达到了 0.86 的 ROC--AUC,而在蛋白质定位上,它达到了 0.95 的 AUC$_{\text{micro}}$ 和 0.74 的 F1$_{\text{micro}}$,展示了在这两项任务上的竞争性能。总的来说,我们的研究结果强调了体积建模和多模态对齐在单细胞显微镜表征学习中的潜力。