通过信息论奖励的在线强化学习对齐医疗会话AI
Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards
摘要
我们提出信息增益微调(IGFT),一种训练医疗会话AI进行有效患者问诊并生成全面现病史(HPI)的新方法,且无需预先收集的人类对话。IGFT将在线Group Relative Policy Optimization(GRPO)与信息论奖励相结合,使模型能够通过与模拟患者的自生成对话进行学习。与依赖昂贵的专家标注对话或静态数据集的现有方法不同,我们的在线RL框架让模型通过探索发现有效的提问策略。我们的关键创新是信息增益奖励函数,它追踪对话过程中揭示了哪些临床实体(如症状、时间模式和病史)。每个问题的奖励基于其期望信息增益,并结合GPT-4o-mini在临床相关性、患者参与度和特异性等维度上的质量评估来计算。这种混合方法确保模型学会提出有针对性、临床上恰当的问题,高效收集诊断信息。我们使用LoRA微调两个模型:Llama-3.1-8B-Instruct和DeepSeek-R1-Distill-Qwen-7B(一个推理优化模型)。仅在包含简洁HPI的Avey数据上训练,我们评估了向具有更长、更详尽HPI的MIMIC数据的泛化。DeepSeek-R1-Distill-Qwen-7B(IGFT)在Avey上取得0.408的F1(较基座提升10.9%),在MIMIC上取得0.289(提升12.9%);Llama-3.1-8B-Instruct(IGFT)分别达到0.384和0.336。两个模型在MIMIC上都超过OpenAI的模型,并胜过HuatuoGPT和UltraMedical等针对单轮医疗问答而非多轮对话优化的医疗领域专用基线。
