论文
通过证据感知奖励和自我纠正偏好学习增强放射学报告生成的强化学习
Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning
摘要
最近的强化学习(RL)方法具有先进的放射学报告生成(RRG),但仍然存在两个核心局限性:(1)报告级奖励为临床提供有限的循证指导 忠实性; (2)当前的方法缺乏明确的自我改进机制来符合临床偏好。我们引入临床一致的证据感知自我校正强化学习(ESC-RL),包括两个关键组成部分。首先,分组证据感知一致性奖励(GEAR)提供分组证据感知反馈。 GEAR 强化了真阳性的一致基础,恢复了误报的遗漏发现,并抑制了误报的不受支持的内容。其次,自我校正偏好学习 (SPL) 策略会根据多个噪声观察自动构建可靠的、疾病感知的偏好数据集,并利用 LLM 来合成精确的报告,而无需人工监督。 ESC-RL 提倡临床上忠实的、与疾病相关的奖励,并支持在训练期间不断自我完善。对两个公共胸部 X 射线数据集的广泛实验证明了一致的增益和最先进的性能。