论文

用于临床增强医疗报告生成的语言对齐和视觉偏好优化

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

模型训练偏好优化

摘要

尽管医疗报告生成 (MRG) 取得了重大进展,但其可靠性仍然受到事实错误普遍存在的限制。虽然直接偏好优化 (DPO) 已成为一种有前景的 后训练 范式,可增强监督微调 (SFT) MRG 模型的性能,但现有的基于 DPO 的 MRG 方法通常采用朴素的偏好结构,将模型生成的报告与 真值 报告直接配对。这种策略无意中将关键的临床发现与临床不相关的语言特征纠缠在一起,并且从根本上缺乏明确的视觉-语言一致性。为了应对这些挑战,我们提出了 DPO-Clin,这是一种新颖的 后训练 框架,其重点是临床发现和跨模式对齐的偏好优化。首先,我们引入实体级临床诊断(ECD)模块来执行精确的实体级事实诊断。 ECD 指导生成语言一致的报告偏好对,从而将临床差异与语言变化隔离开来。其次,为了实现细粒度的跨模态对齐,我们开发了 M2DPO,这是一种检索增强的多模态 DPO 变体,可强制由视觉上下文切换触发的文本偏好反转。第三,我们找到正确但高度不确定的预测实体,并应用反事实修改来构建有针对性的偏好数据以缓解潜在风险,从而进一步提高模型的可靠性。对两个公共胸部 X 射线数据集(MIMIC-CXR 和 IU X 射线)和内部内窥镜数据集的广泛实验表明,DPO-Clin 显着改善了临床感知指标的 SFT 基线。此外,它比现有的基于 DPO 的 MRG 方法具有卓越的性能,在不同的基线架构和不同的医学成像模式中表现出强大的通用性。