论文

用于胸部 X 射线判读的推理视觉语言基础模型

A Reasoning-Enabled Vision-Language Foundation Model for Chest X-ray Interpretation

应用与实践行业应用

摘要

胸部 X 光检查 (CXR) 是全球最常进行的影像检查之一,但成像量的增加增加了放射科医生的工作量和诊断错误的风险。尽管人工智能 (AI) 系统已显示出 CXR 解读的前景,但大多数系统仅生成最终预测,而没有明确说明如何将视觉证据转化为放射学结果和诊断预测。我们推出了 CheXOne,一种用于 CXR 解释的推理视觉语言模型。 CheXOne 联合生成诊断预测和明确的、基于临床的推理轨迹,将视觉证据、放射线检查结果和这些预测联系起来。该模型使用来自 30 个公共数据集(涵盖 36 个 CXR 解释任务)的 1470 万个指令和推理样本进行训练,使用将指令调整与强化学习相结合的两阶段框架来提高推理质量。我们在视觉问答、报告生成、视觉基础和推理评估等零样本设置中评估 CheXOne,涵盖 17 种评估设置。 CheXOne 的性能优于现有的医疗和通用领域基础模型,并在独立的公共基准测试中取得了强劲的性能。一项临床读者研究表明,CheXOne 起草的报告在 55% 的病例中与住院医生撰写的报告相当或更好,同时有效解决了临床适应症并提高了报告撰写和 CXR 解释效率。放射科医生参与的进一步分析表明,生成的推理痕迹显示出较高的临床事实性,并为最终预测提供因果支持,为性能提升提供了合理的解释。这些结果表明,显式推理可以提高 AI 辅助 CXR 解释中的模型性能、可解释性和临床实用性。