论文

DALPHIN:在开放的多中心数据集上对数字病理学 AI 副驾驶员与病理学家进行基准测试

DALPHIN: Benchmarking Digital Pathology AI Copilots Against Pathologists on an Open Multicentric Dataset

模型评测基准与评测资源

摘要

具有数字病理学视觉问答功能的基础模型正在出现。这种前所未有的技术需要独立的基准测试来评估其协助病理学家进行常规诊断的潜力。我们创建了 DALPHIN,这是第一个针对病理 AI 副驾驶的多中心开放基准,包含来自 300 个病例的 1236 张图像,涵盖 130 个罕见到常见的诊断、6 个国家和 14 个亚专业。 DALPHIN 设计和数据集与来自 10 个国家、具有不同专业知识的 31 名病理学家的人类表现基准一起引入。我们报告了两名通用(GPT-5、Gemini 2.5 Pro)和一名病理特定副驾驶(PathChat+)的顺序和独立答案生成的结果。我们观察到,PathChat 的 6 项任务中有 4 项、Gemini 的 2/6 任务和 GPT 的 1/6 任务与专家级表现没有统计上的显着差异。 DALPHIN 是通过隔离的、可间接访问的 真值 公开发布的,以促进稳健且持久的基准测试。数据、方法和评估平台可通过 dalphin.grand-challenge.org 获取。