论文
评估药物安全推理对患者信息的反事实敏感性
Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning
摘要
应用有效的药物安全规则在患者特定条件不满足时会产生错误的决策。现有的医疗评估主要使用孤立且固定的场景。因此,一个模型可能通过回忆药物风险关联来正确回答问题,而不展示它是否使用了患者的输入来决定规则是否适用。为解决这一差距,我们引入MedPIC-Bench,这是一个源可验证推荐和专家验证问题的基准,用于患者特定的药物安全推理。它结合指南跟随的问题与配对的因果性问题,在控制下改变患者的输入信息时,使规则的应用发生变化。基准包含6个临床和推理维度标注的467个问题。在28种医疗专用、一般和私有的LLMs上,每种模型在因果性问题上的表现都比指南跟随问题差,准确率从63.6%下降到45.1%。当明确的患者属性直接信号熟悉的禁忌症时,模型在因果性问题上表现出色,但在需要缩小或撤回安全警告的情况下,模型在因果性问题上的表现不佳。模型的逻辑通常承认改变后的患者信息,但最终答案保留了之前的安全判断。这种可变性存在于医疗专用LLMs中,其平均CF性能低于一般LLMs。因此,MedPIC-Bench使条件规则应用可衡量,并突显了静态药物安全准确性评估患者特定可靠性的局限性。
