论文

科学领域知识改善视觉语言眼底模型

Scientific Domain Knowledge Improves Vision-Language Fundus Models

模型评测基准与评测资源

摘要

视觉语言模型为眼科带来了巨大的希望,但仍不清楚哪种训练数据源最能传达专家领域知识。现有的眼科模型是根据固定文本模板、医学报告或一般生物医学文献进行训练的,这些来源从未在匹配条件下进行过比较。为了在比较中包含特定领域的文献,我们提出了 PubMed-Ophtha,这是一个具有高域密度的分层数据集,包含 102,023 个面板,其子标题来自 PubMed Central 的 15,842 篇开放获取文章。然后,我们使用一般生物医学文献模型作为基线,对每个来源的相同 CLIP 模型进行微调,发现特定领域文献在 110 项临床任务中实现了最佳平均性能,达到平均线性探测 AUROC 88.63%,领先于医学报告 (85.68%)。将数据集限制为眼底图像、医疗报告数据集的图像计数或与评估数据集无关的文章并不会降低性能,这表明收益可能源于域密度。我们发布了数据集、微调模型和完整的生成流程。