论文

CDPR:面向成本感知序贯医疗诊断的反事实优势贡献分配

CDPR: Counterfactual Advantage-based Credit Assignment for Cost-Aware Sequential Medical Diagnosis

模型训练强化学习RLVR

摘要

临床诊断是一个循序渐进、注重成本的过程:医生一次安排一项检查,观察结果,并在得出最终结论之前更新诊断。相反,大多数医学语言模型将诊断视为一次性分类任务,并忽略测试的价值和成本之间的权衡。我们将诊断建模为成本感知的顺序决策过程,并通过强化学习来训练策略。主要困难是信用分配:唯一可靠的信号出现在长轨迹的末端,因此它的结果是浪费的检查与有效的检查相同。我们提出 CDPR(反事实诊断过程奖励),它不需要专家标签,也不需要博学的批评家。 CDPR 首先利用其行动分布的不确定性找到政策犹豫的状态,然后根据其相对于政策本身考虑的替代方案的优势对所选行动进行评分,并在平衡正确性与测试计数、成本和不可行请求的效用下进行短期部署估计。转出缓存重用批内轨迹以保持较低的成本。我们将 CDPR 集成到 GRPO 中,并在一个域内 (MIMIC-IV) 和两个域外(ClinicalBench 和私人医院数据集)基准测试上对其进行测试。 CDPR 提高了诊断准确性,同时明显减少了检查次数和成本。

CDPR:面向成本感知序贯医疗诊断的反事实优势贡献分配:论文配图
图1:三种诊断模式的比较。(a) 静态诊断:该模型立即提供完整记录,包括不相关或昂贵的检查,并要求将诊断结果单传。(b) 现有的动态诊断方法:模型逐步获得证据,但每次中间行动都得到同样的结果奖励。(c) 我们的:我们把所选择的行动与反事实的替代办法加以对比,以建立过程奖励制度,提供密集的监督,奖励信息化行动并惩罚多余或低价值的行动。