论文

GeneICL:面向批量转录组的表格基础模型

GeneICL: A Tabular Foundation Model for Bulk Transcriptomics

模型训练预训练

摘要

基因表达在生物医学中被广泛测量,但由于高维度、强特征相关性和有限的标记数据,临床结果预测仍然具有挑战性。大型自监督转录组基础模型通常无法超越简单的监督基线。表格基础模型通过上下文学习提供了一种替代方案,但通常是在通用合成数据而不是转录组结构上进行预训练的。我们询问转录组学感知的预训练(而不是规模)是否是缺失的要素。为此,我们引入了 GeneICL,这是一个 4.2M-参数表格基础模型,它将根据测量的批量表达谱构建的半合成预训练先验与参数高效循环架构相结合。我们进一步通过使用 Cox 部分似然残差将 无需训练还原为回归来实现右删失生存预测。我们在 80 个临床结果预测任务上评估 GeneICL,涵盖分类、回归和生存。表格基础模型始终优于自监督转录组模型,而 GeneICL 在评估的基础模型和调整基线中实现了最佳总体排名。 GeneICL 可以将参数减少多达 387$\times$,推理时无需更新梯度,并在笔记本电脑 CPU 上在几秒钟内进行预测。

GeneICL:面向批量转录组的表格基础模型:论文原图
图 2:GeneICL 概述。 (a) 基于转录组学的预训练。变分自动编码器(VAE)在未标记的真实批量转录组上进行训练。解码器用于生成合成表达数据集。随机采样的非线性函数将各个配置文件映射到每个样本的分类或回归标签。生成的数据集被分为标记支持集和查询集,形成一个综合预训练任务。 (b) GeneICL 架构。转录组图谱通过安装有支架的 PCA 进行投影并输入编码器。支持标签的标签嵌入被添加到编码器中和权重循环上下文学习 (ICL) 转换器块的每次迭代中的支持 token 中。分类和回归头从查询 token 中读出预测。 (c) 基准。 GeneICL 与表格和转录组学基础模型以及传统基线进行比较(性能示意性显示,参见表 1)。