论文

Fundus-R1:利用公共数据的知识感知推理来训练眼底阅读 MLLM

Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data

模型训练奖励建模与过程监督

摘要

CFP、OCT 和 UWF 等眼底成像对于早期发现视网膜异常和疾病至关重要。眼底图像理解由于其知识密集的性质,提出了具有挑战性的视觉语言任务。解决该任务的一种新兴方法是通过监督微调 (SFT) 或通过可验证奖励的强化学习 (RLVR) 对大量内部样本与高质量临床报告进行后训练通用多模态 大语言模型 (MLLM)。然而,这些有价值的样本无法公开获取,这不仅阻碍了可重复性,而且实际上限制了少数参与者的研究。为了克服这一障碍,我们做出了一种新颖的尝试,使用专门的公共数据集来训练推理增强型眼底阅读 MLLM,我们将其称为 Fundus-R1,其中超过 94% 的数据仅使用图像级标签进行注释。我们的技术贡献有两个方面。首先,我们提出了一种基于 RAG 的方法来构建特定于图像的知识感知推理轨迹。这种自动生成的痕迹将通用 MLLM 识别的视觉发现与眼科知识方面的图像标签联系起来。其次,我们通过过程奖励来增强 RLVR,鼓励每条采样轨迹时生成的推理轨迹的自我一致性。对三个眼底阅读基准(即 FunBench、Omni-Fundus 和 GMAI-Fundus)的广泛实验表明,Fundus-R1 明显优于多个基线,包括其通用对应版本 (Qwen2.5-VL) 和不使用生成轨迹进行后训练的更强版本。这项工作为使用公开数据训练强大的眼底读取 MLLM 铺平了道路。