论文

SFT 后医学图像字幕的临床结构化替代奖励

Clinically Structured Surrogate Rewards for Post-SFT Medical Image Captioning

模型训练奖励建模与过程监督

摘要

医学图像字幕需要将异质视觉证据转化为简洁的临床描述,其中发现、断言状态或解剖关系中的错误可能会改变临床意义,尽管表面上很流畅。序列级策略优化可以直接优化完整的说明,但常见的奖励依赖于全局文本相似性、直接图像说明兼容性或无序概念重叠,从而使视觉邻域和临床声明结构隐含。我们提出了一个用于 SFT 后医学图像字幕的临床结构化替代奖励框架。该框架将生物医学语义和短程词汇保真度与两种结构化奖励相结合:分布图像邻域对齐,它与参考和生成的标题引起的医学图像库分布相匹配,以及临床图一致性,它对实体、断言状态和类型关系应用最大权重一对一匹配。这四种奖励在每个采样轨迹组内独立标准化,结合固定的相对权重,并使用 GDPO 进行优化。在组织者评估的标准和合成 ImageCLEF 医学字幕轨道和三个视觉语言主干的隐藏测试集中,该方法在所有六个主干轨道组合中比匹配的 SFT 基线提高了整体性、相关性和事实性,平均相对增益分别为 3.4%、2.1% 和 5.8%。消融和配对诊断表明,结构化奖励提供了互补信号,减少了图像邻域分歧并提高了实体断言关系一致性。