论文
用于 PSMA PET/CT 报告生成、视觉问答和病灶分割的统一视觉语言模型
A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion Segmentation
摘要
准确的 PSMA PET/CT 解读对于前列腺癌管理至关重要,但现有的 PET/CT AI 模型通常只能解决孤立的任务。我们提出了一个统一的 PSMA PET/CT 视觉语言模型,用于报告生成、视觉问答和病变分割。该框架采用LLaVA风格的架构,包括PET/CT视觉编码器、MLP-Mixer投影模块、LoRA调整的大语言模型和3D分割分支。训练遵循四阶段策略:视觉编码器预训练、投影层对齐、VLM 微调和最终多任务调整。语言任务使用 5,747 个 PSMA PET/CT 数据集和配对报告,而分割则使用 AutoPET 的 PSMA 子集。该模型在标准报告生成指标方面优于 PET2REP 和基于 CT 的基线,提高了 VQA 问题类型的性能,并实现了比 SegAnyPET 和 nnUNet 更高的 Dice 和病变级别重叠 F1。这些结果支持在单一多任务模型架构内建立一个统一框架的可行性,该框架可用于结构化、交互式、可解释的 PSMA PET/CT 分析,并具有体素级基础。