论文
MedVol-R1:体积推理分割的奖励驱动证据基础
MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation
摘要
体积推理分割 (VRS) 旨在从自由形式的临床查询中分割 3D 医学扫描中的目标区域,其中所指对象通常是隐式的,需要医学知识和基于体积的推理。现有的方法通常依赖于专门的分段标记来将语言与掩码解码连接起来,但这种耦合将决策过程压缩为不透明的潜在表示,限制了对不同叙事表达的可解释性和泛化。在本文中,我们提出了 MedVol-R1,一种基于强化学习的 VRS 框架,它明确地将证据基础与体积描绘分离:LVLM 将临床推理基础到可验证的 2D 证据锚点(关键轴向切片和 2D 边界框),然后通过冻结的 MedSAM2 模块将其传播到连贯的 3D 掩模中。我们使用冷启动监督的 微调 和 GRPO 来训练 MedVol-R1,以鼓励信息证据选择、准确的 2D 空间基础和跨切片体积一致性的多成分奖励为指导,而不需要昂贵的思想链注释。 M3D-Seg 基准测试中的 CT-ORG、AbdomenCT-1K 和 KiTS23 实验表明,MedVol-R1 始终优于强大的基线并实现了最先进的性能,强化学习比纯监督 微调 提供了明显的收益。