论文

通过判别性指导增强 3D CT 报告生成中的细粒度空间基础

Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance

应用与实践行业应用

摘要

用于放射学报告生成 (RRG) 的视觉语言模型 (VLM) 可以通过体积扫描生成长篇胸部 CT 报告,并显示出提高放射学工作流程效率和一致性的强大潜力。然而,现有方法面临两个关键限制:(i)训练监督通常是粗略的,将整个 CT 体积与完整的自由文本报告对齐,而没有针对细粒度属性或病理位置进行明确对齐; (ii) 评估通常是整体性的(词汇重叠、实体匹配或 LLM 法官评分),而不是空间基础的诊断。我们提出了 \emph{Discriminative Cue-Prompting with Prompt Dropout (DCP-PD)},这是一个即插即用的框架,可以从自由文本报告中提取细粒度的提示,并使用它们来指导报告生成,同时通过提示 dropout 减轻对快捷方式的依赖。 DCP-PD 在 CT-RATE 上实现了最先进的性能,将宏观 F1 从 $=0.501$ 提高到 $0.603$(相对 20%),并将 Rad-ChestCT 的分布外性能从 F1 $=0.266$ 提高到 $0.503$(相对 89%)。最后,我们引入了一种分层的、位置感知的问题集协议(存在 $\rightarrow$ 侧向 $\rightarrow$ 叶)来直接评估病理位置基础,表明即使对于在当前基准上得分较高的模型,细粒度的空间定位仍然具有挑战性。