MLLM-HWSI:用于分层整个幻灯片图像理解的多模态 大语言模型
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
摘要
全幻灯片图像 (WSI) 呈现层次结构,其中诊断信息来自细胞形态、区域组织组织和全局背景。现有的计算病理学 (CPath) 多模态 大语言模型 (MLLM) 通常将整个 WSI 压缩为单个嵌入,这阻碍了细粒度的基础,并忽略了病理学家如何跨不同尺度综合证据。我们引入了 \textbf{MLLM-HWSI},这是一种分层 WSI 级 MLLM,它将视觉特征与病理语言在四种不同的尺度(细胞作为单词、补丁作为短语、区域作为句子和 WSI 作为段落)对齐,以支持可解释的基于证据的推理。 MLLM-HWSI 将每个 WSI 分解为具有特定尺度投影仪的多尺度嵌入,并共同强制 (i) 分层对比目标和 (ii) 跨尺度一致性损失,从而保持从单元到 WSI 的语义一致性。我们使用轻量级 \textit{Cell-Cell Attention Fusion (CCAF)} Transformer 计算诊断相关的补丁,并将分段的细胞嵌入聚合到每个补丁的紧凑的细胞词元中。投影的多尺度标记与文本标记融合,并馈送到经过指令调整的 LLM,用于开放式推理、VQA、报告和图像描述生成任务。经过三个阶段的训练,MLLM-HWSI 在 6 个 CPath 任务的 13 个 WSI 级基准上取得了新的 SOTA 结果。通过将语言与多尺度视觉证据结合起来,MLLM-HWSI 提供了准确、可解释的输出,反映了诊断工作流程并促进了对 WSI 的整体理解。代码位于:\href{https://github.com/BasitAlawode/HWSI-MLLM}{GitHub}。