论文

VOICE:集成直接和基于检索的原位单细胞基因表达预测的视觉组学基础模型

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

上下文与知识检索增强

摘要

空间转录组学可以在单细胞分辨率下解析基因表达,但成本昂贵,仅限于数百到数千个基因的目标组,并且仅适用于少量样本。相比之下,H&E 成像成本低廉,并且可以定期大规模收集。这使得直接从形态学预测单细胞表达成为将分子分析应用于大型组织档案的实用方法。因此,我们提出了 VOICE,这是一种多模态基础模型,可使用配对的 Xenium 数据从 H&E 图像中预测单细胞基因表达。 VOICE 首先将来自病理学基础模型的以细胞为中心的 H&E 形态与来自转录组基础模型的单细胞表达嵌入对齐,并使用超过 2300 万个细胞的对比学习进行训练。接下来,它通过两个分支预测表达。一个分支直接从形态学上回归表达。另一个分支检索相似参考细胞的测量表达,恢复没有形态信号的基因。由于基因的形态可预测性各不相同,因此 VOICE 将两个分支与每个基因的权重融合在一起。训练后,VOICE 可以推广到 Xenium 中保留的患者、幻灯片和部分重叠的基因组,并且它在七个指标上始终优于先前的单细胞表达预测方法。