论文
打破失败级联:医学多模态推理的逐步感知强化学习
Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
摘要
最近的多模态 大语言模型 在临床图像推理方面显示出了巨大的前景,但现有的 后训练 管道仍然主要以结果为中心,依赖于最终答案的正确性或序列级偏好。这受到贡献分配稀疏的影响,使得难以优化临床应用所必需的推理过程。我们的分析表明,早期推理失败导致的级联错误是医学视觉问答 (VQA) 基准中预测错误的主要原因。受此启发,我们提出了医学推理感知策略优化(MRPO),这是一种包含逐步过程奖励的强化学习算法。当最终答案不正确时,MRPO 会对早期无效推理步骤中的词元分配指数级更大的惩罚,从而在不影响成功路径的情况下打破失败级联。在四个多模态 LLM 主干中,MRPO 始终优于标准 GRPO 和最近的 RL 基线,并且在 Qwen3-VL-8B-Thinking 上甚至超过了规模更大的医疗 MLLM,例如 HuatuoGPT-Vision-34B 4.59 个点。此外,MRPO 将早期推理失败率从 58.6% 降低到 13.4%,这表明有针对性地缓解级联失败可以提高推理质量和最终答案的准确性。我们的代码位于 https://github.com/dmis-lab/MRPO