论文
SDR:面向放射报告生成的集合距离奖励
SDR: Set-Distance Rewards for Radiology Report Generation
摘要
带可验证奖励的强化学习快速推动了视觉-语言模型的推理能力。然而,对于胸部X光报告生成,标准奖励(即精确匹配准确率和步骤级过程)并不适用,因为报告由无序且相互独立的发现构成,而非因果推理链。我们以集合视角弥补这一空缺:将每份报告切分为句子并用冻结的句子transformer嵌入,得到无序的嵌入集合。我们提出使用生成嵌入与参考嵌入之间的集合到集合距离作为连续的、置换不变的奖励。在两个数据集与三个视觉-语言模型(Qwen3-VL-2B/4B、Gemma3-4B)上,通过GRPO以集合距离奖励进行后训练,在所有主要指标(BERTScore、RadGraph F1和CheXbert F1)上持续优于监督微调与精确匹配GRPO,相对提升平均分别为6.80%、7.82%和4.45%。同样的集合距离还可用于测试时best-of-$N$选择:以候选与训练报告嵌入的距离打分,在我们训练的模型以及三个闭源LLM(Mistral-Small、Gemini-2.5 Flash-Lite、GPT-4o-mini)上都优于随机选择,BERTScore平均相对提升16.4%。作为流式信号使用时,它们支持更高效的测试时扩展形式:在生成中途剪除低分候选可减少超过50%的生成token,同时保持完整best-of-$N$选择的Findings质量。这些结果共同确立了集合距离奖励作为胸部X光报告生成中后训练与测试时扩展的统一信号。我们的代码已公开提供。
