论文

用于生成放射学报告的诊断条件空间门控和解码器级监督对比学习

Diagnosis-Conditioned Spatial Gating and Decoder-Level Supervised Contrastive Learning for Radiology Report Generation

应用与实践行业应用

摘要

放射学报告生成模型可以生成流畅的文本,同时仍然包含发现级别的不准确之处。诊断驱动的方法通过调节预测结果来改进生成,但这些预测不会直接修改提供给解码器的视觉块特征,并且全局门控在空间位置上应用相同的调制。我们引入了位置感知门(PAG),它使用预测发现表示来在空间上调制视觉块,而无需区域监督。我们还提出了一种解码器级监督对比损失(DSCL),它使用共享的积极发现而不是实例身份来构建解码器表示。在 MIMIC-CXR 上,与匹配的全局门参考相比,PAG+DSCL 将临床疗效 (CE) F1 从 0.484 提高到 0.502,而 PAG 和 DSCL 分别达到 0.491 和 0.495。在没有额外的微调的情况下,组合模型在 IU X 射线上达到 0.226 CE F1,而 PromptMRG 报告的 CE F1 为 0.211。

用于生成放射学报告的诊断条件空间门控和解码器级监督对比学习的原论文方法或结果图
图 2:建议的框架。在训练期间,地面实况查找状态提供诊断驱动提示token,而分类器预测状态驱动 PAG。在推理中,分类器预测同时发挥这两种作用。 PAG 融合状态和发现身份嵌入,关注 $S$ 视觉补丁,并为每个位置生成一个空间门 $\gamma_{s}$。门控补丁充当解码器交叉注意力记忆。 DSCL 使用由共享的真实阳性结果定义的阳性对来监督汇集的解码器表示。