论文

重新审视3D CT报告生成中的LLM适配:模型规模与诊断先验

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

模型训练参数高效训练

摘要

多模态大语言模型在自然图像上具有适应能力,但三维医学影像的计算复杂度、体积依赖及视觉特征与临床术语之间的语义差异,使迁移更困难。少量医学数据上的直接微调容易过拟合并产生临床幻觉,偏重语言流畅而忽略事实。本文研究体积CT报告生成的参数高效适配,提出轻量诊断先验条件框架RAD3D-Prefix,将图像嵌入与多标签诊断分类logits结合,以保留临床细节并衔接语义。LLM保持冻结,仅训练少量参数,以缓解小型领域数据集上的过拟合风险。针对96.1M至1.6B参数模型的系统比较发现,较小模型更受益于微调,而约1B以上模型采用冻结LLM并只训练轻量投影层,可更好平衡效果、泛化与计算效率。多个自动指标及临床读者评估显示,RAD3D-Prefix优于可比参数高效基线,在使用明显少于全量微调的参数时保持较强的分布外泛化。