论文
通过跨尺度推理增强病理 VLM
Enhancing Pathological VLMs with Cross-scale Reasoning
摘要
病理图像本质上是多尺度的,要求病理学家将低放大倍数下的整体组织结构的证据整合到较高放大倍数下的细胞形态学的证据,以进行准确的诊断。虽然视觉语言模型(VLM)的现有病理数据集包括各种尺度,但它们通常缺乏明确的跨尺度推理目标。这种限制使得 VLM 无法捕获必要的跨尺度表征并学习基于证据的推理。为了弥补这一差距,我们引入了第一个跨尺度训练和评估范式,将病理学解释制定为多放大推理。然而,创建这样的任务揭示了一个关键的挑战:多图像视觉问答(VQA)很容易出现纯文本快捷方式,这使得模型可以使用依赖于放大倍数的伪像而不是视觉证据来猜测答案。为了解决这个问题,我们提出了一种泄漏感知管理管道,它将对抗性纯文本筛选与约束引导的问题设计相结合。使用此流程,我们构建了 Scale-VQA,这是一个高质量基准,包含 4,685 个多项选择题,这些问题基于跨多个放大级别的 2,537 个病理图像。最后,我们提出了 ScaleReasoner-R1,这是一个通过强化学习训练的模型,用于优化跨规模 VQA 任务的性能。 ScaleReasoner-R1 在我们的跨尺度推理基准上实现了最先进的性能,并在已建立的单尺度基准上推广到 SOTA 性能。研究结果表明,即使是有限的跨尺度监督也可以显着提高病理理解。代码可在 https://github.com/iMVR-PL/ScaleReasoner-R1 获取。