论文

REVA-PO:稳定胸部 X 射线报告生成的强化学习

REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation

模型训练强化学习

摘要

自动胸部 X 射线报告生成最近受益于强化学习 (RL) 和 大语言模型。然而,由于固定的 Kullback-Leibler (KL) 正则化和随着时间的推移积累 KL 压力的静态参考策略,强化学习训练经常会遇到不稳定或有限的探索。我们提出了响应加权和验证锚定策略优化(REVA-PO),这是一种通过响应加权正则化(RER)和验证锚定策略重置(VAPR)来稳定长期训练的强化学习框架。 RER 根据优势和参考策略熵动态调整每个响应的 KL 权重,放宽对高质量响应的约束,同时收紧对低质量响应的约束。作为补充,VAPR 定期将参考和当前策略同步到最佳验证检查点,重置累积的正则化压力以扩大可行的探索空间。为了确保一个稳健的起点,我们采用了一个三阶段管道,包括热身训练、分类器引导的监督 微调 和 RL。对 MIMIC-CXR 和 IU-Xray 的广泛评估表明,REVA-PO 在语言质量和临床准确性方面树立了新的最先进基准。值得注意的是,与之前的领先方法相比,BLEU-4 在 MIMIC-CXR 上提高了 5.1%,在 IU-Xray 上提高了 3.6%,而 CheXpert F1 和 RadGraph F1 分数分别提高了 4.5% 和 12.8%。该代码可在 https://github.com/LiGuo12/REVA_PO/ 上公开获取。