论文
Ker-VLJEPA-3B:以课程学习生成三维CT报告
Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression
摘要
三维CT放射学报告生成面临序列极长、类别严重不平衡,以及大语言模型偏重语言先验而忽略视觉词元的问题。Ker-VLJEPA-3B采用四阶段课程学习,从胸部CT体数据生成自由文本报告,逐步使Llama 3.2 3B解码器依据冻结自监督编码器的视觉特征生成内容。视觉骨干LeJEPA ViT-Large在无标注CT上进行自监督联合嵌入预测,不使用文本监督;视觉语言对齐在后续桥接与生成阶段进行,基础训练无需配对文本。方法包括:用区域约束交叉注意力将切片嵌入压缩为32个具有空间对应关系的视觉词元;对各向异性语言模型嵌入进行PCA白化;仅使用阳性发现训练以消除后验坍塌;迁移投影权重进行桥接初始化;结合选择性交叉注意力冻结和弹性权重巩固避免灾难性遗忘。在CT-RATE的2,984个验证体数据、18个类别上,宏平均F1为0.429,相比U-VLM的0.414相对提高3.6%;阈值优化后达到0.448,相对提高8.2%。消融分析将56.6%的生成质量归因于患者特定视觉内容。代码和模型权重已开放。