论文

CXR-Retrieve:胸部放射成像中的组合文本到图像检索

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

模型评测基准与评测资源

摘要

大型胸部放射摄影档案很难搜索,因为大多数研究仅与自由文本报告配对,而不是结构化临床注释。视觉语言模型为文本到图像检索提供了一个自然的界面,但当前的生物医学模型主要针对报告到图像匹配进行优化,而不是为了满足简短的临床搜索查询。这会造成客观不匹配:模型可能会检索与查询中的单词相关的图像,但无法满足完整的临床约束,特别是对于诸如“肺不张且无肺炎”之类的连词和否定词。我们引入了 CXR-Retrieve,这是一种用于组合胸部 X 射线文本到图像检索的结构化基准。该基准测试包含来自 MIMIC-CXR-JPG 官方测试分割的 5,159 个测试图像,以及涵盖单个和联合结果(正面和负面)的 145 个文本查询。相关性是通过检索到的图像是否满足所有断言的病理学约束来定义的,而不是通过它是否与配对报告匹配来定义。我们进一步提出了用于临床检索的标签感知对比 微调 目标。我们的方法吸引具有兼容的断言病理学约束的图像文本对,包括共享确认的缺席,同时明确排斥矛盾的对。从域内 CXR-CLIP 检查点开始,我们的方法在两种病理连接上比 CXR-CLIP 提高了 Precision@5 8.5 个百分点,在否定查询上提高了 22.0 个百分点。这些结果表明,可靠的胸部 X 射线检索需要训练目标,不仅要模拟提到的发现,还要模拟它们在临床上的断言方式。