论文
用于腰椎管狭窄症诊断的具有自适应 PID-Tversky 损失的可解释视觉语言模型框架
An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis
摘要
腰椎管狭窄症 (LSS) 的诊断仍然是一个关键的临床挑战,诊断严重依赖于多视图磁共振成像 (MRI) 的劳动密集型手动解释,导致观察者之间存在很大的差异和诊断延迟。现有的视觉语言模型同时无法解决临床分割数据集中普遍存在的极端类别不平衡问题,同时又无法保持空间准确性,这主要是由于全局池化机制放弃了关键的解剖层次结构。我们提出了一个端到端的可解释视觉语言模型框架,旨在克服这些限制,通过两个主要目标来实现。我们提出了一个空间补丁交叉注意模块,能够以空间精度对脊柱异常进行精确的、文本引导的定位。一种新颖的自适应 PID-Tversky 损失函数通过集成控制理论原理,动态地进一步修改训练惩罚,以专门解决困难的、分段不足的少数实例。通过将基础 VLM 与自动放射学报告生成模块结合起来,我们的框架表现出了相当大的性能:诊断分类准确度为 90.69%,分割的宏观平均 Dice 得分为 0.9512,CIDEr 得分为 92.80%。此外,该框架通过将复杂的分割预测转换为放射科医生风格的临床报告来显示可解释性,从而为临床医学成像中透明、可解释的人工智能建立新的基准,在增强诊断能力的同时保持必要的人类监督。