论文

PathView-Bench:多模态大语言模型能否实现对病理图像的细粒度多尺度理解?

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)正被越来越多地用于分析病理图像。然而,病理领域主流的多模态基准主要对最终诊断答案、描述或报告打分。这些评测难以说明模型是否理解病理推理与决策所需的多尺度视觉内容。我们提出 PathVU,一个面向计算病理学中细粒度、多尺度视觉理解的以视觉为锚的基准。PathVU 基于 23 个带人工监督标签与空间标注的公开病理成像数据集构建,在两种视野下评测 MLLM 的理解能力:面向高分辨率局部区域的 Region FOV 和面向宏观全切片视图的 Slide FOV。通过将原始标注转化为确定性任务目标,PathVU 支持对区域定位、视觉识别、数量估计、空间推理和上下文不足判断的程序化打分。该基准包含 14 个 VQA 风格任务、61,673 张图像和 308,070 个样本,覆盖 28 个器官和 7,253,526 条标注。通过对 18 个代表性的通用、医疗领域与病理专用 MLLM 进行评测,我们观察到即便是先进模型,在多尺度病理图像的细粒度视觉任务上也存在明显局限。PathVU 为开发和评测具备显式多尺度视觉理解的病理 MLLM 提供了可复现的基础。

PathView-Bench:多模态大语言模型能否实现对病理图像的细粒度多尺度理解?:论文配图
图 1:PathView-Bench 的激励示例。该基准通过视觉锚定的病理学任务评估跨局部区域和整个幻灯片视野的视觉理解。