论文

PCQC:多轮医学对话的特权反事实问题学分

PCQC: Privileged Counterfactual Question Credit for Multi-Turn Medical Dialogue

模型训练奖励建模与过程监督

摘要

大语言模型(LLM)在医学问答方面取得了实质性进展,但有效的医学对话还需要学习提出问题以揭示相关患者信息。为了训练此类对话策略,通用管道将监督微调与基于最终诊断正确性的强化学习 (RL) 结合起来。然而,这种基于结果的监督并不能直接区分单个问题的贡献,也不能为未执行的替代方案提供问题级反馈。为了解决这一差距,我们引入了 PCQC(特权反事实问题信用),它在训练期间使用特权患者信息来从从未提出的问题中学习。在训练期间,PCQC 通过使用优先的患者事实来构建答案,从而使替代问题在同一对话状态下直接进行比较。冻结诊断评分器通过每个问答对对正确诊断的支持程度来评估其诊断效用。 PCQC 将这些比较转化为相对问题信用,告诉策略哪些问题优先,直接监督已执行和未执行的问题以及基于结果的强化学习,而不需要完整执行未被选中的备选轨迹。跨越四个医学基准的大量实验表明,PCQC 的平均诊断准确率达到 63.10%,分别比 GRPO 和 ATPO 高 4.38 个百分点和 4.21 个百分点。与 GRPO 相比,查询次数减少了 33.1%,从而实现了这些收益。