论文
KEPIL:知识增强的即时图像学习,用于快速稳健的疾病检测
KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection
摘要
视觉语言模型(VLM)显示出放射学临床决策支持的前景,因为它们能够对放射图像和临床文本进行联合推理,从而利用互补的临床信息。然而,放射学发现在实践中存在长尾现象,导致某些情况未被充分代表,因此零样本推断至关重要。然而,当前的 CLIP 式医疗 VLM 对即时变化很敏感,并且在推理时往往缺乏可信的外部知识,这阻碍了可靠的临床部署。我们提出了 \textit{KEPIL},这是一个快速鲁棒的框架,它集成了精选的医学知识以稳定零样本泛化。 KEPIL 包括:(i)在 LLM 辅助下使用本体的 \emph{动态提示丰富},(ii)通过双嵌入目标对齐等效提示变体的嵌入的 \emph{语义感知对比损失},以及(iii)\emph{以实体为中心的报告标准化}以产生本体对齐的表示。在七个基准测试中,KEPIL 实现了最先进的零样本推理性能;在提示变异测试中,它在 \textit{CheXpert} 上将 AUC 提高了 \(6.37\%\),平均提高了 \(4.11\%\)。这些结果表明,结构化知识和稳健的提示设计是临床可靠的面向放射学的 VLM 的关键。代码将在 https://github.com/Roypic/KEPIL 发布。