语义上下文感知模态融合 Transformer (SCOUT):用于生成基于概念的病理学报告的上下文感知多模态 Transformer
Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation
摘要
全幻灯片病理报告生成需要模型集成局部组织形态学、全局组织背景和诊断相关语义信息,但现有方法通常依赖于固定的预训练视觉表示,可能无法表示关键的诊断概念。在这里,我们介绍 SCOUT:语义上下文感知模态融合 Transformer,这是一个基于概念的多模态框架,集成了局部组织学模式、整个幻灯片上下文和专家策划的诊断概念。 SCOUT 维护不断发展的视觉表示以及递归更新的幻灯片和概念条件表示,允许视觉和上下文信息在编码器深度上迭代地共同进化。在解码过程中,在自适应多模态融合模块针对每个生成的词元将它们组合之前,单独的注意力路径会关注这些互补流。我们在 TCGA-BRCA、HistAI 和 REG-2025 上评估了 SCOUT,其中包含超过 7 种癌症类型的 20,900 多个 WSI 报告对。使用常见的 CONCHv1.5 功能和评估协议,SCOUT 的性能优于 WSI-Caption、HistGen 和 Bi-Gen,相对于最强的竞争方法,BLEU 分数平均提高 9.6%,METEOR 提高 11.0%,ROUGE-L 提高 3.6%。在 REG-2025 上,SCOUT 还将临床报告质量得分提高了 5.6%,这表明除了词汇相似性之外,临床相关报告属性得到了更好的保留。消融显示了迭代上下文细化和自适应融合的互补贡献,而学习门提供了可检查的模态使用的 词元级 估计。我们的结果表明,渐进式上下文调节在异质病理学报告生成设置中是有效的,并为将领域知识集成到计算病理学的视觉语言模型中提供了灵活的框架。