论文

梦想:通过自适应多模态融合实现动态视网膜增强,以生成专家精准的医疗报告

DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation

应用与实践行业应用

摘要

自动化视网膜图像医疗报告需要视觉模式识别和深厚的临床知识的复杂结合。当前的大型视觉语言模型 (LVLM) 在数据稀缺的专业医学领域中常常举步维艰,导致模型过度拟合并错过微妙但关键的病理。为了解决这个问题,我们引入了 DREAM(自适应多模态融合动态视网膜增强),这是一种用于生成高保真医疗报告的新颖框架,即使在数据有限的情况下也能表现出色。 DREAM 采用独特的两阶段融合机制,将视觉数据与眼科医生策划的临床关键词智能集成。首先,抽象模块将图像和关键词特征映射到共享空间,通过病理相关的见解增强视觉数据。接下来,适配器执行自适应多模态融合,使用可学习参数动态加权每种模态的重要性以创建统一的表示。为了确保模型的输出在语义上以临床现实为基础,对比对齐模块在训练期间将这些融合表示与 真值 医疗报告对齐。通过将医学专业知识与高效的融合策略相结合,DREAM 在 DeepEyeNet 基准上创下了新的最先进水平,取得了 0.241 的 BLEU-4 分数,并进一步展示了对 ROCO 数据集的强大泛化能力。