论文
RadAgent:用于胸部计算机断层扫描逐步解读的工具使用型AI智能体
RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography
摘要
视觉-语言模型(VLM)显著推进了对计算机断层扫描(CT)等复杂医学影像的AI驱动解读与报告。然而,现有方法在很大程度上把临床医生置于最终输出被动观察者的位置,没有提供可供其检查、验证或修正的可解释推理轨迹。为解决这一问题,我们提出 RadAgent,一个通过逐步且可解释的过程生成CT报告的工具使用型AI智能体。每份生成的报告都附带一条完全可检查的中间决策与工具交互轨迹,使临床医生能够审视所报告的发现是如何得出的。在实验中,我们观察到 RadAgent 在三个维度上改进了其 3D VLM 对应模型 CT-Chat 的胸部CT报告生成。临床准确度在 macro-F1 上提升 5.8 个百分点(相对提升 35.4%),在 micro-F1 上提升 5.1 个百分点(相对提升 18.6%)。对抗条件下的鲁棒性提升 24.7 个百分点(相对提升 41.9%)。此外,RadAgent 的忠实度达到 37.0%,这是一项其 3D VLM 对应模型完全缺失的新能力。通过将胸部CT解读结构化为显式、工具增强且迭代的推理轨迹,RadAgent 让我们向透明可靠的放射科AI更近一步。
