论文

CT-$Δ$Bench:使用视觉语言模型进行纵向 3D 医学成像差异报告的基准

CT-$Δ$Bench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models

模型评测基准与评测资源

摘要

在医学成像中,计算机断层扫描 (CT) 的临床价值不仅在于描绘当前的疾病状态,更重要的是能够对连续扫描进行纵向比较,以确定疾病的演变,这是支撑反应评估、复发检测和持续患者管理的过程。然而,尽管时间比较在临床决策中发挥着核心作用,但现有的医学基础模型仍然很大程度上局限于单一研究的理解,导致基于时间的交叉检验没有得到充分解决。为了解决这一差距,我们研究了纵向成像差异报告,在该任务中,模型对同一患者进行两次时间上分离的扫描,并生成一份有临床意义的报告,描述它们之间的间隔变化。我们引入了 CT-$Δ$Bench,这是该任务的专用基准,具有患者级别的分割以防止信息泄漏。为了更好地评估这项超越表面文本相似性的任务,我们进一步开发了专门设计用于捕获有临床意义的纵向变化的变化感知指标,并进行独立的医生验证以评估合成参考和事件提取管道的可靠性。我们还将直接配对 CT 推理与间接两级管道进行比较,后者首先生成单时间点报告,然后执行文本差异。最后,我们提出了 DeltaMed,一种用于直接配对 CT 差异报告的基线模型,并在基准训练集上对其进行训练。总之,这些贡献为时间感知医学基础模型奠定了基础,更好地反映现实世界的纵向临床推理。