论文

通过信息论奖励的在线强化学习对齐医疗会话AI

Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards

模型训练强化学习

摘要

我们提出信息增益微调(IGFT),一种训练医疗会话AI进行有效患者问诊并生成全面现病史(HPI)的新方法,且无需预先收集的人类对话。IGFT将在线Group Relative Policy Optimization(GRPO)与信息论奖励相结合,使模型能够通过与模拟患者的自生成对话进行学习。与依赖昂贵的专家标注对话或静态数据集的现有方法不同,我们的在线RL框架让模型通过探索发现有效的提问策略。我们的关键创新是信息增益奖励函数,它追踪对话过程中揭示了哪些临床实体(如症状、时间模式和病史)。每个问题的奖励基于其期望信息增益,并结合GPT-4o-mini在临床相关性、患者参与度和特异性等维度上的质量评估来计算。这种混合方法确保模型学会提出有针对性、临床上恰当的问题,高效收集诊断信息。我们使用LoRA微调两个模型:Llama-3.1-8B-Instruct和DeepSeek-R1-Distill-Qwen-7B(一个推理优化模型)。仅在包含简洁HPI的Avey数据上训练,我们评估了向具有更长、更详尽HPI的MIMIC数据的泛化。DeepSeek-R1-Distill-Qwen-7B(IGFT)在Avey上取得0.408的F1(较基座提升10.9%),在MIMIC上取得0.289(提升12.9%);Llama-3.1-8B-Instruct(IGFT)分别达到0.384和0.336。两个模型在MIMIC上都超过OpenAI的模型,并胜过HuatuoGPT和UltraMedical等针对单轮医疗问答而非多轮对话优化的医疗领域专用基线。

通过信息论奖励的在线强化学习对齐医疗会话AI
图1:医学对话的在线训练框架。Doctor LLM 生成问题,由 Patient LLM 回答,后者模拟来自 ground truth HPI 的病例。信息增益奖励通过把已揭示的实体与 ground truth 对比来计算,并结合基于 LLM 的质量评估。模型基于这些奖励通过 GRPO 更新,形成一个无需人类对话数据即可改进提问策略的在线学习循环。Generated HPI(以绿色显示)仅在评估期间生成以衡量性能,不在训练期间生成。