论文

RadAgent:用于胸部计算机断层扫描逐步解读的工具使用型AI智能体

RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography

智能体系统Agent 工具调用

摘要

视觉-语言模型(VLM)显著推进了对计算机断层扫描(CT)等复杂医学影像的AI驱动解读与报告。然而,现有方法在很大程度上把临床医生置于最终输出被动观察者的位置,没有提供可供其检查、验证或修正的可解释推理轨迹。为解决这一问题,我们提出 RadAgent,一个通过逐步且可解释的过程生成CT报告的工具使用型AI智能体。每份生成的报告都附带一条完全可检查的中间决策与工具交互轨迹,使临床医生能够审视所报告的发现是如何得出的。在实验中,我们观察到 RadAgent 在三个维度上改进了其 3D VLM 对应模型 CT-Chat 的胸部CT报告生成。临床准确度在 macro-F1 上提升 5.8 个百分点(相对提升 35.4%),在 micro-F1 上提升 5.1 个百分点(相对提升 18.6%)。对抗条件下的鲁棒性提升 24.7 个百分点(相对提升 41.9%)。此外,RadAgent 的忠实度达到 37.0%,这是一项其 3D VLM 对应模型完全缺失的新能力。通过将胸部CT解读结构化为显式、工具增强且迭代的推理轨迹,RadAgent 让我们向透明可靠的放射科AI更近一步。

RadAgent:用于胸部计算机断层扫描逐步解读的工具使用型AI智能体
图 1:RadAgent 概述。 a 给定 3D CT 体积和用户查询,RadAgent 首先生成初始报告草稿,然后进入由临床医生启发的诊断检查表引导的代理循环。在每一步中,代理都会计划下一个诊断操作,从工具箱中选择适当的工具,使用工具输出更新其内存,并完善其发现,直到收集到足够的证据来生成最终报告。 b 说明性示例跟踪,显示代理如何通过连续的工具调用来验证初步结果并将证据积累到完整的报告中。 c 培训和评估流程,包括综合奖励设计、临床医生审查的清单构建、基于 GRPO 的代理培训以及内部和外部胸部 CT 基准评估。