论文

CURE-Med:面向多语言医疗推理的课程式强化学习

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

模型训练强化学习

摘要

尽管大语言模型(LLM)在单语数学与常识推理上表现良好,它们在多语言医疗推理应用中仍然不可靠,阻碍了其在多语言医疗环境中的部署。我们首先介绍 CUREMED-BENCH,一个高质量的多语言医疗推理数据集,包含有单一可验证答案的开放式推理查询,覆盖十三种语言,包括阿姆哈拉语、约鲁巴语和斯瓦希里语等欠代表语言。在该数据集基础上,我们提出 CURE-MED,一个课程式强化学习框架,融合码转换感知的监督微调与 Group Relative Policy Optimization,共同提升逻辑正确性与语言稳定性。在十三种语言上,我们的方法持续优于强基线并有效扩展,在 7B 参数下达到 85.21% 的语言一致性和 54.35% 的逻辑正确率,在 32B 参数下达到 94.96% 的语言一致性和 70.04% 的逻辑正确率。这些结果支持在 LLM 中实现可靠且公平的多语言医疗推理。代码与数据见 https://cure-med.github.io/

CURE-Med:面向多语言医疗推理的课程式强化学习
图1:用于多语言医学推理的 Cure-Med 流程。该框架经历三个阶段:(A) 精选来自 MedlinePlus 等来源的经临床验证的多语言数据,以实现跨语言推理;(B) 在语码转换的推理轨迹上对 Qwen2.5-Instruct 底座模型进行监督微调;(C) GRPO 引导的课程强化学习,从高资源语言逐步训练到中、低资源语言,以增强逻辑正确性和语言一致性。