论文

MedLoc-R1:基于 GRPO 的医学视觉基础的绩效感知课程奖励安排

MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

模型训练奖励建模与过程监督

摘要

医学视觉基础是细粒度多模态推理和可解释的临床决策支持的重要基础。尽管最近在基础任务的强化学习(RL)方面取得了进展,但现有的方法,如组相对策略优化(GRPO),在直接应用于医学图像时,会遭受严重的奖励稀疏性,这主要是由于定位小的或模糊的感兴趣区域的固有困难,而强化学习中基于固定 IoU 的奖励方案的刚性和次优性质进一步加剧了这种困难。这导致政策梯度消失和优化停滞,特别是在早期训练期间。为了应对这一挑战,我们提出了 MedLoc-R1,这是一种绩效感知奖励调度框架,可根据模型准备情况逐步收紧奖励标准。 MedLoc-R1 引入了滑动窗口性能跟踪器和多条件更新规则,可自动将奖励计划从密集、易于获得的信号调整为更严格、细粒度的定位要求,同时保留 GRPO 的有利特性,而无需引入辅助网络或额外的梯度路径。对三个医学视觉定位基准的实验表明,与基于 GRPO 的基准相比,MedLoc-R1 持续提高了定位精度和训练稳定性。我们的框架为高风险医疗应用中基于强化学习的定位提供了通用、轻量且有效的解决方案。代码\&检查点可在\hyperlink{}{https://github.com/MembrAI/MedLoc-R1}获取。