论文

风格感知放射学报告的语料库表征和逆宪法微调

Corpus Characterization and Inverse Constitutional Fine-Tuning for Style-Aware Radiology Reports

模型训练监督微调与指令调优

摘要

自动放射学报告生成在诊断准确性方面取得了迅速进步,但生成的报告在结构、措辞和不确定性语言方面经常与真实放射科医生写作的文体惯例有所不同,这种差距对临床医生的信任和用户体验有直接影响。为了解决这个问题,我们使用 Bio-ClinicalBERT 嵌入、UMAP 降维和 HDBSCAN 聚类来描述 CheXpert Plus 数据集中 2,000 份报告的文体变化,识别出在病理焦点、叙述结构和词汇偏好方面不同的五种不同的报告模式。根据这些发现,我们采用逆宪法人工智能框架,从放射科医生编写的报告对中导出以风格为中心的宪法,而不需要正式的偏好数据集。该构成、语气、措辞、不确定性校准和报告结构的编码惯例,被纳入对 25,245 个 CheXpert Plus 训练对的 MedGemma-4B 基础模型的监督微调中。相对于未调整的基线,体质微调使文本对齐显着增加(BLEU-4:0.006 至 0.308;ROUGE-L:0.171 至 0.484)。这些成果表明结构和词汇对齐发生了质的转变,而不是边际改进,因为基线模型由于格式不匹配而产生接近零的分数。总体而言,我们建立了语料库级别的风格表征和构成建模,作为一种有效且数据高效的策略,用于生成符合真实放射科医生写作惯例的放射学报告。