论文
超越理想化患者:在医疗咨询中评估具有挑战性的患者行为下的 LLM
Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations
摘要
大语言模型 (LLM) 越来越多地用于医疗咨询和健康信息支持,其中安全性不仅取决于医学知识,还取决于对不清楚、不一致或误导性患者输入的强有力的反应。然而,大多数现有的医学 LLM 评估都假设理想化且适当的患者问题,限制了其现实性。我们研究真实医疗咨询中常见的具有挑战性的患者行为,这些行为使安全临床推理变得复杂。我们将此类行为定义为四种基于临床的类别:信息矛盾、事实不准确、自我诊断和护理抵制。对于每种行为,我们指定了捕获不安全响应的具体失败标准。基于四个现有的医学对话数据集,我们引入了 CPB-Bench(挑战患者行为基准),这是针对这些行为注释的多轮对话的双语(英语和中文)基准。我们发现,尽管模型总体表现良好,但它们表现出一致的特定行为失败,特别是在处理矛盾或医学上不可信的患者信息时。我们进一步评估了四种干预策略,发现了不一致的改进,其中一些干预措施引入了不必要的纠正。