论文

透过专家之眼:基于放射科医生注视与推理训练的基础视觉语言模型

Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning

模型训练预训练

摘要

大规模视觉语言模型在自动化胸部X光解读方面已展现出前景,但其临床实用性仍受限于模型输出与放射科医生推理之间的差距。大多数系统只优化语义信息,而不模拟专家目视检查医学影像的方式,常常遗漏关键征象或偏离既定诊断工作流。放射科医生遵循结构化规程(如ABCDEF方法),确保所有临床相关区域都得到系统性检查,从而减少漏诊并支撑可靠的诊断推理。我们提出GazeX,一个利用放射科医生眼动追踪数据作为行为先验来建模专家诊断推理的视觉语言模型。通过将注视轨迹和注视点模式纳入预训练,GazeX学会遵循放射科医生注意力的空间与时间结构,并以具有临床意义的顺序整合观察结果。基于来自五位放射科医生、超过30,000个注视关键帧的精选数据集,并结合231,835例放射影像研究、780,014个问答对以及1,162个带边界框的图文对,我们证明GazeX在放射报告生成、疾病定位和视觉问答任务上产生更准确、更可解释、与专家更一致的输出。与自主报告系统不同,GazeX产生可验证的证据产物,包括检查轨迹和与征象关联的定位区域,支持高效的人工核验与安全的人机协作。通过专家之眼学习,为放射学及其他领域构建更可信、更可解释、诊断上更稳健的AI系统提供了一条切实可行的路径。

透过专家之眼:基于放射科医生注视与推理训练的基础视觉语言模型:论文配图
图 1:放射科医生引导的结构化胸部 X 射线解读的诊断推理模式。 a,放射科医生的注视行为展示了结构化且可重复的诊断工作流程。眼球追踪捕获多位专家的注视轨迹,揭示与临床医生既定阅读协议一致的常见注意力模式。专家间轨迹的统计分析显示出一致的相关性,突出了胸部 X 射线判读过程中共享的视觉策略。启用大型视觉语言模型来学习这种标准化的阅读工作流程有可能提高各种临床下游任务的性能。 b,注意力引导的视觉观察与临床定义的类别(即气道、呼吸、循环、隔膜、外部设备和异物)保持一致,从而提供图像特征(来自检查区域内不同区域的视觉线索)和诊断推理之间的语义映射。 c,在多步骤诊断过程中集成来自关键解剖区域的视觉线索,以支持结构化报告生成。 d,分割、视觉问答 (VQA) 和报告生成等下游任务受益于模型与专家凝视的一致性。该图说明了专家眼动数据如何捕获放射决策的时间和空间逻辑,作为监督信号来指导人工智能模型生成临床基础和可解释的报告。 e,GazeX 支持的临床医生循环工作流程。 GazeX 提供检查线索和发现相关区域来支持系统审查和人工验证,使放射科医生能够在最终报告之前验证或编辑模型建议。