论文

通过基于空间的病变证据实现临床可解释的眼科 VQA

Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

模型评测基准与评测资源

摘要

视觉问答 (VQA) 为临床支持带来了巨大希望,特别是在眼科领域,视网膜眼底照相对于诊断至关重要。然而,眼科 VQA 基准主要强调答案准确性,忽略了临床可解释性所需的明确视觉证据。在这项工作中,我们介绍了 FundusGround,这是一种具有空间基础病变证据的临床可解释眼科 VQA 的新基准。具体来说,我们提出了一个三阶段的流程,收集 10,719 张眼底图像和 15,595 个图像级精心注释的病变。为了确保解剖学一致性和临床有效性,所有病变均使用早期治疗糖尿病视网膜病变研究 (ETDRS) 网格进行空间定位,从而能够标准化映射到九个有临床意义的视网膜区域。基于这种结构化的病变证据,随后生成了 72,706 个问题,涵盖四种格式:开放式、封闭式、单项选择和多项选择。我们使用双重指标进一步对多个通用和医学大型视觉语言模型进行基准测试,以实现答案准确性和病变级别推理。实验表明,结合病变级视觉证据持续提高模型性能和透明度,强调了明确的空间基础对于可靠且可解释的眼科 VQA 的必要性。