论文

DobicVLM:通过团体相关政策优化,使胸部 X 光报告生成与基于临床的计划奖励保持一致

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

模型训练奖励建模与过程监督

摘要

医学成像是诊断的基石,但自动生成胸部 X 射线报告在结构依从性、解剖完整性和语义方面存在困难 忠实性。我们推出了 DobicVLM,这是一种视觉语言模型,将 MedGemma-4B 上的监督 微调 与组相对策略优化 (GRPO) 和基于临床的程序性奖励相结合。我们的方法使用可解释的、基于规则的奖励组件;结构验证、解剖检查表、语义相似性和长度限制,以在没有神经奖励模型的情况下执行临床标准。 DobicVLM 接受了来自私人临床数据集的 1,000 个去识别化图像报告对的训练(经过伦理批准并遵守当地法规),并通过对 69 个保留病例进行盲法专家审查进行评估。 DobicVLM 在大多数标准上均优于 Gemini 2.5 Flash,与 Gemini 2.5 Flash 和 MedGemma 4B 基线相比,获得了最高的印模准确率 (27.2%) 和医学术语 (86.5%),但在完整性和转介方面略有折衷。这证明了 GRPO 在资源有限的环境中透明对齐的价值。关键词:视觉语言模型、放射学报告生成、强化学习、医疗人工智能、GRPO