论文

Retina-RAG:用于联合视网膜诊断和临床报告生成的检索增强视觉语言建模

Retina-RAG: Retrieval-Augmented Vision-Language Modeling for Joint Retinal Diagnosis and Clinical Report Generation

应用与实践行业应用

摘要

糖尿病视网膜病变 (DR) 是全球工作年龄成年人可预防性失明的主要原因,但大多数自动筛查系统仅限于图像级分类,并且缺乏临床结构化报告。我们提出了 Retina-RAG,这是一种低成本的模块化框架,可联合执行 DR 严重程度分级、黄斑水肿 (ME) 检测和报告生成。该架构将高性能视网膜分类器和通过低秩适应 (LoRA) 适应的参数高效视觉语言模型 (Qwen2.5-VL-7B-Instruct) 解耦,从而实现灵活的组件集成。检索增强生成(RAG)模块在推理时将精选的眼科知识与结构化分类器输出一起注入,以提高诊断一致性并减少幻觉。 Retina-RAG 在 DR 分级方面的 F1 分数为 0.731,在 ME 检测方面的 F1 分数为 0.948,在带字幕的视网膜疾病检测数据集上远远优于零样本 Qwen(0.096,0.732)和 MMed-RAG(0.541,0.641)。对于报告生成,Retina-RAG 达到了 ROUGE-L 0.438 和 SBERT 相似度 0.884,超过了所有基线。完整的框架在单个消费级 GPU 上运行,表明可以使用适度的计算资源来实现临床结构化的视网膜人工智能。