论文

PathoArgus:在十亿像素整幻灯片和多幻灯片案例上下文中推进基于证据的长上下文视觉推理

PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts

模型评测基准与评测资源

摘要

全幻灯片病理学推理需要模型在完整的病例相关幻灯片中整合千兆像素级的视觉证据,但当前的问答基准主要测量最终答案的准确性——这一指标容易受到语言先验和基准规律的影响,并且不足以确定预测是否基于所提供的组织。我们推出 PathoArgus-Bench,这是一个基准和评估协议,可明确测试完整的证据链:可用性、可访问性、使用性和响应性。 PathoArgus-Bench 包含来自 15 个 TCGA 项目的 4,913 名患者的 22,078 个四选题,涵盖三个级别的证据需求的六种病理功能,并在固定的读者预算下运行,仅保留十亿像素背景的一小部分。为了进一步分离基于证据的推理,我们贡献了 ESG(证据状态四重奏),这是一组 483 个四重奏的受控集合,其中问题文本是固定的,而目标 WSI 集被移动、替换或删除,需要在所有状态之间进行一致的预测。评估 20 个通用、医学和病理学专用系统揭示了一个明显的差距:虽然 GPT-5.6 的总体准确率达到 57.09%,ESG 准确率达到 57.04%,但它仅正确完成了 483 个四重奏中的 19 个(QExact 为 3.93%),暴露出行级准确度并不能转化为可靠的证据基础。我们还引入了 PathoArgus,这是一种固定预算阅读器,通过问题相关性和空间覆盖范围来分配上下文,总体准确率达到 50.39%,但 QExact 仅为 1.86%,这表明仅改进上下文访问并不能确保一致的基于证据的预测。我们的基准和诊断表明,获取有用的整个幻灯片背景是必要的,但还远远不够,并呼吁计算病理学中从以答案为中心的评估转向以证据为基础的评估。