论文
MedScribe:通过代理工作流程提供基于临床的 CT 报告
MedScribe: Clinically Grounded CT Reporting through Agentic Workflows
摘要
视觉语言模型 (VLM) 已显示出自动生成放射学报告的潜力,但现有方法依赖于体积数据的全局嵌入压缩,通常会导致幻觉结果和 3D CT 成像中的解剖学基础有限。我们引入了 MedScribe,这是一个假设驱动的框架,它将报告生成重新表述为迭代证据获取过程,而不是单遍编码任务。 MedScribe 将报告建模为一个顺序决策过程,其中 大语言模型 动态调用病理学特定诊断工具来提取局部体积特征。这些结构化特征用于查询与病理学特定文本证据一致的多维检索空间。通过在综合之前明确积累定量证据,该框架强制执行细粒度的基础并减少不受支持的主张。与最先进的 2D 和 3D VLM 相比,在没有特定于任务的 微调 的情况下,MedScribe 提高了 CT-RATE 和 RadChestCT 的临床准确性、事实一致性和可解释性,证明了假设驱动推理对于可靠的医学图像报告的价值。