论文
分割、检测和解释:CT 外观推理的统一框架
Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning
摘要
深度学习的最新进展显着推进了 CT 图像分析,特别是分割任务。然而,这些进步很大程度上局限于图像级模式识别,大多数方法缺乏明确的解剖或上下文推理。大型视觉语言模型将语言上下文引入图像分析中,但大多数方法通常专注于单个任务,这对于需要多种细粒度类型分析(例如解剖检测和分割)的临床工作流程分析来说是不够的。在本文中,我们提出了一个统一的自回归框架,将语言引导的视觉推理集成到 CT 解释中。我们的方法引入了任务路由标记,这些标记触发以大型视觉语言模型的隐藏状态为条件的检测和分割头,从而能够连贯地生成视觉输出(例如,掩模和边界框)和文本推理。为了逐步提高定位精度和语义清晰度,我们进一步设计了一种“近视”机制,允许模型在细化视野下对感兴趣区域进行渐进的粗到细访问。为了支持 模型训练 和评估,我们策划了一个新的多模态 CT 数据集,其中包含像素级掩模、边界框、空间提示和通过人工验证的人工智能辅助注释过程构建的视觉对象的结构化描述。公共基准测试表明,SoTA 取得了持续改进,在 BTCV 上实现了高达 1.0% 的 Dice,在 MosMed+ 上实现了高达 1.7% 的 Dice,同时还提供了外观推理输出。代码和数据集将可用。