论文

从基础模型潜在空间生成临床可操纵视网膜图像的评估

Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces

模型评测鲁棒性、公平性与可信度评测

摘要

医学基础模型学习具有临床意义的表型的潜在表示,但它们支持可控图像生成的能力在很大程度上仍未得到探索。我们在表示分词器框架内评估了四个视网膜基础模型,并检查在合成图像生成过程中是否保留了基础模型潜在表示中编码的人口统计和临床信息。我们表明,在原始基础模型中进行评估时,生成的表示和图像忠实地继承了表型信息,在多个下游预测任务上始终优于传统的潜在扩散。然而,当使用在真实图像上训练的分类器进行评估时,这些收益很大程度上消失了,揭示了以前未表征的合成与真实表示之间的差距。这些发现表明,基础模型潜在空间为可控视网膜合成提供了强大的基础,同时强调需要更好地将合成表示与真实图像分布对齐。