用于生成病例级病理学概要报告的简单、词元高效的视觉语言模型
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
摘要
由于十亿像素分辨率、较长的视觉标记序列以及病例级推理的复杂性,从全幻灯片图像 (WSI) 生成临床上有用的病理病例报告具有挑战性,其中单个病例可能包含多个具有异质组织和模糊结果的 WSI。我们提出了一种简单的词元高效视觉语言模型,用于生成案例级概要报告,该模型在 GPU 内存有限的情况下仍然实用。我们的架构遵循最小的三组件设计:冷冻病理补丁编码器、轻量级两层 MLP 视觉语言对齐器和 大语言模型 解码器,并具有显式 WSI 标记词元来分隔病例内的切片。训练分两个监督阶段进行:(1) 使用异构 WSI 文本对进行仅对齐器 WSI 字幕,(2) 对案例报告对进行案例级监督 微调,以生成结构化报告。为了减少序列长度,我们在 $5\times$ 放大倍数下使用 $512\times 512$ 补丁来表示每张幻灯片,与常用的 $20\times$ 补丁相比,这将平均序列长度减少了高达 $64\times$ 倍。结合高效的训练技术,我们仅用一半的 NVIDIA H100 GPU 即可实现实际训练。在这两个训练阶段,我们的方法都获得了很高的 ROUGE-L/METEOR/BLEU-4 分数,同时在内存和运行时方面显着提高了效率。在基于人工智能的评估中,我们的模型始终优于强基线。广泛的消融体现了性能与效率之间的权衡,并确定了可提高多 WSI 设置中稳健性的简单选择。总体而言,这项工作为高效病理报告生成提供了强大的、可重复的基线,降低了有限计算下多 WSI VLM 研究的障碍。代码可在 https://github.com/AtlasAnalyticsLab/PathoSynVLM 获取。