论文

通过知识增强的数据合成引发医学推理:半监督强化学习方法

Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach

模型训练强化学习

摘要

虽然 大语言模型 有望实现复杂的医疗应用,但其发展却因缺乏高质量推理数据而受到阻碍。为了解决这个问题,现有方法通常通过监督 微调 从大型专有模型中提取思想链推理轨迹,然后进行强化学习(RL)。这些方法对罕见疾病等代表性不足的领域表现出有限的改进,同时由于生成复杂的推理链而产生大量成本。为了有效增强医学推理,我们提出了 MedSSR,一种医学知识增强数据合成和半监督强化学习框架。我们的框架首先利用罕见疾病知识来合成分布可控的推理问题。然后,我们利用策略模型本身来生成高质量的伪标签。这实现了两阶段、内在到外在的训练范式:在伪标记合成数据上进行自监督强化学习,然后在人工注释的真实数据上进行监督强化学习。 MedSSR 可有效扩展 模型训练,无需依赖昂贵的跟踪 蒸馏。在 Qwen 和 Llama 上进行的大量实验表明,我们的方法在十个医学基准上优于现有方法,在罕见疾病任务上实现了高达 +5.93% 的增益。我们的代码可在 https://github.com/tdlhl/MedSSR 获取。