论文

微调开放权重模型以从放射学报告中提取实体的技术比较

Comparison of techniques for fine-tuning open-weight models for entity extraction from radiology reports

模型训练监督微调与指令调优

摘要

将自由文本放射学报告转换为结构化标签支持队列建设、质量保证和临床成像模型的监控,但最强大的标签提取器是托管的专有模型,其使用会引发隐私、成本和可重复性问题。我们询问微调开放权重模型 (Gemma-3-12B) 在从头部非增强CT 报告中提取多标签颅内出血 (ICH) 新旧程度方面是否可以与 GPT-4o 相匹配,以及哪些成分很重要。使用 2x2 设计,我们将两种适应策略(判别性分类头,CH;生成指令微调,IFT)与两个训练数据源(真实 GPT-4o 标记报告的蒸馏;GPT-4o 从真实样本生成的合成报告)交叉,跨越五个训练规模,以 100 个针对 GPT-4o 和未调整的开放权重基础的专家评审报告为基准。蒸馏后指令微调模型 (DIFT) 与 GPT-4o 匹配(宏 F1 0.845 与 0.850;p = 1.000),并且超出基本模型 0.178。决定性因素是训练数据源,而不是微调方法:两种合成数据模型在任何训练规模下都未能超过未调整的开放权重基础,并且在所有新旧程度类别中都表现不佳。微调和推理适合单个 24 GB 消费级 GPU 的内存范围。对于范围狭窄、高价值的临床标签提取任务,对真实报告进行蒸馏而不是生成合成报告可以缩小与托管模型的差距,从而实现私有、低成本、版本稳定的本地替代方案。