论文
表示驱动的内窥镜视觉嵌入对齐潜在生成
Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation
摘要
开发内窥镜基础生成模型受到自然图像和临床图像之间的差距以及训练大型 Diffusion Transformer 的计算成本的限制。尽管表示对齐提高了一般计算机视觉的效率,但其在高度专业化的内窥镜图像空间中的作用仍不清楚。我们引入 REVEAL(表示驱动的内窥镜视觉嵌入对齐),这是迄今为止最大的内窥镜生成基础模型,在 GastroNet-5M (GN-5M) 上进行训练,GastroNet-5M (GN-5M) 是一个包含 500 万个内窥镜帧的多中心数据集。 REVEAL 不依赖域外先验,而是采用直接在内窥镜分布上预训练的编码器,将扩散潜伏与特定域的视觉特征对齐,保留精细的纹理和复杂的解剖结构。除了图像生成之外,REVEAL 还可以用作强大的特征提取器;在多个基准测试中,它提供的性能可与专门针对分类任务进行调整的内窥镜基础模型(例如 EndoViT 和 Endo-FM)相媲美,甚至在某些情况下超过它们,同时在真实成像损坏情况下展现出强大的表示稳健性。 REVEAL 可以生成高保真图像,并在潜在空间编辑(例如修复和修复)中保持强大的结构连贯性。这种高容量主干降低了构建专业临床工具的计算门槛,为未来智能胃肠病学系统中的条件合成、分割和分布外检测提供了开放、多功能的基础。