论文

MApLe:诊断报告和大型医学图像的多实例对齐

MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images

应用与实践行业应用

摘要

在诊断报告中,专家将复杂的成像数据编码为临床可操作的信息。他们描述了在其解剖学背景下有意义的微妙病理发现。报告遵循相对一致的结构,用很少的文字表达诊断信息,这些信息通常与微小但重要的图像观察相关。标准视觉语言模型很难识别这些信息文本组件与图像中的小位置之间的关联。在这里,我们提出了“MApLe”,一种克服这些限制的多任务、多实例视觉语言对齐方法。它解开了解剖区域和诊断结果的概念,并以补丁方式将局部图像信息与句子联系起来。我们的方法包括经过训练以捕获句子中的解剖和诊断概念的文本嵌入、以解剖结构为条件的分块图像编码器以及这些表示的多实例对齐。我们证明 MApLe 可以成功地对齐自由文本报告中的不同图像区域和多个诊断结果。我们表明,在对几个下游任务进行评估时,与最先进的基线模型相比,我们的模型提高了对齐性能。代码可在 https://github.com/cirmuw/MApLe 获取。