论文
MedAgent-R1:面向循证医学推理的忠实性感知强化学习
MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning
摘要
当医疗人工智能系统产生临床推理幻觉时,其后果不仅仅是错误的答案:表面上引用检索到的证据的捏造理由可能会误导临床医生做出不安全的治疗决策。因此,医学推理代理不仅必须提供正确的答案,还必须提供临床医生可以根据引用的证据进行验证的忠实理由。我们在强化学习训练的检索代理中发现了一种系统性失败模式:仅结果奖励提高了准确性,同时降低了忠诚度,我们将这种现象称为“自信幻觉”。智能体从参数记忆中学习回答,并回填看似合理但不受支持的理由;即使准确性比监督基线提高了 5 个百分点,引文伪造率也从 16.5% 上升到 31.8%。我们通过忠诚度门控奖励设计来解决这个问题:准确性信用的条件是通过硬门建立证据,并辅以检索有效性和简洁性信号,关闭代理检索特有的利用路径。由此产生的系统 MedAgent-R1 将引文伪造从 31.8% 减少到 4.7%,并将证据完整性从 58.7 提高到 82.6,同时保持 75.1% 的准确性,HealthBench 安全性提高了 13.2 点。在相同的代理检索设置下,MedAgent-R1 在特定忠诚度维度上的得分超过了 GPT-4o(事实支持 4.55 与 4.25;夸大其词 4.40 与 4.15),同时在整体准确性方面保持低于 GPT-4o,这表明明确的忠诚度训练产生的证据基础增益是仅通过扩展无法实现的。