论文

使用图约束的多实例学习工作流程分解整个幻灯片图像报告生成

Decomposing Whole Slide Image Report Generation with Graph-Constrained Multiple Instance Learning Workflows

模型推理推理策略与问题分解

摘要

全幻灯片图像 (WSI) 报告生成需要识别空间分布的病理特征并将其组织成连贯的诊断叙述。尽管直接视觉到文本模型可以产生流畅的报告,但它们掩盖了视觉识别、结构化推理和语言生成的贡献和失败模式。我们提出了一个分解框架,其中冻结 Virchow2 瓦片嵌入由多实例学习 (MIL) 分类头聚合,回答特定器官的诊断问题。器官条件图将这些答案限制为结构化推理链,语言模型将其实现为病理报告。在 REG2026 保留的 2,028 张幻灯片集上,建议的工作流程获得了 0.702 的链 Jaccard 分数。在没有基于图的链构建的情况下,性能下降至 0.420;当器官特定图被单个器官不可知图取代时,性能下降至 0.398;当语言模型根据 MIL 预测自由构建链时,性能下降至 0.371。使用相同的报告生成器,图结构链将报告分数从 0.330 提高到 0.495。在跨越七个没有 微调 的 REG 器官的 350 个外部 TCGA WSI 中,64.0% 的病例选择了预期器官图,并以 86.6% 的比例跻身前三名。提供正确的器官图将粗略 TCGA 初级诊断标签的一致性从 61.8% 提高到 92.6%,将器官路由确定为域转移下的主要瓶颈。总体而言,器官条件、图形约束的链组装改进了结构化推理和报告生成,同时实现了特定于阶段的错误定位。