论文
NV-Reason-CT:用于 CT 分析的 3D 视觉语言模型
NV-Reason-CT: 3D Visual Language Model for CT Analysis
摘要
我们提出了 NV-Reason-CT,这是一种用于胸部和腹部 CT 的生成视觉语言模型,将原生 3D 视觉编码与放射科医生引导推理相结合。该模型将原生 3D 视觉转换器与语言模型相结合,将所有视觉标记及其显式 3D 坐标传递到语言解码中,而无需进一步的空间标记合并。这在视觉编码器内以及在与文本联合处理期间通过语言模型的位置编码保留了体积空间信息。我们使用来自 70,111 个独特 CT 图像输入的约 550,000 个多模式指令示例的精选语料库进行训练,结合了标准化报告、异常聚焦和解剖特定问题、多轮交互以及放射科医生根据记录和转录的专家 CT 解释进行的推理。专家注释提供直接监督并指导额外的基于报告的综合推理。端到端监督微调(SFT)之后是组相对策略优化(GRPO),对胸部和腹部异常集提供可验证的奖励。该模型支持异常分类、报告生成以及具有可审查观察、鉴别诊断和不确定性的交互式推理。评估涵盖公共 CT 基准和 NIH 队列。在 CT-RATE 上,NV-Reason-CT 在没有特定于任务的分类头的情况下实现了 0.614 的宏 F1 和 0.871 的宏 AUROC;生成的报告的报告导出宏 F1 为 0.592。在与放射科医生专家进行的一项初步研究中,人工智能辅助审查获得了良好的置信度,并且平均报告判读和报告时间减少了 50%。我们发布模型和训练代码,以支持体积医学成像可解释人工智能的可重复研究。