论文

使用视觉语言基础模型进行文本引导的多序列胶质瘤亚区域分割细化

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

模型训练参数高效训练

摘要

背景:准确的胶质瘤亚区域勾画对于放疗计划和纵向监测很重要,但手动轮廓校正非常耗时。 nnU-Net 等模型的泛化能力可能不完善,并且缺乏临床医生指导的文本校正。目的:我们研究了如何采用三维 (3D) 视觉语言基础模型来进行文本引导的脑肿瘤分割细化。方法:我们开发了一个基于 VoxTell 的轻量级框架。预训练的 VoxTell 生成初始掩模。 Oracle 提示源自编码目标、操作、位置、成像证据、编辑大小和保存约束的分段错误。 Frozen Qwen/VoxTell 提示嵌入通过可训练投影注入其多尺度解码器调节中;其他重量保持冻结状态。训练、验证和测试使用了 901、100 和 250 个 BraTS-GLI 案例。对 100 例脑膜瘤、转移瘤、儿科肿瘤和 UPENN-GBM 病例进行了跨数据集转移评估。结果:在使用对比后 T1 加权输入的内部测试集上,正确的指令将分区 Dice 相似系数(DSC;增强肿瘤、水肿和坏死/非增强核心)从 $0.774\pm0.158$ 提高到 $0.796\pm0.137$。它们的表现优于空白提示($0.762\pm0.155$;Holm 调整的 $p<0.001$,$d_z=0.71$)和矛盾提示($0.770\pm0.163$;$p<0.001$,$d_z=0.48$)。在跨数据集测试中,正确的指令将 DSC 从 $0.527\pm0.287$ 提高到 $0.550\pm0.278$,并且优于矛盾的指令 ($0.504\pm0.275$; $p<0.001$, $d_z=0.43$)。结论:3D 视觉语言基础模型可以对神经胶质瘤亚区域分割进行指令引导的细化。对正确、空白和矛盾提示的敏感性表明依赖于文本的轮廓编辑而不是非特异性后处理,支持作为临床医生在环工具的进一步评估。