论文

当 大语言模型 在医疗保健领域失败时:评估提示变化的敏感性

When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 在医疗保健领域越来越多地用于临床问答、诊断支持和报告总结等任务。尽管前景广阔,但这些模型仍然对词汇和句法上的细微提示扰动高度敏感,这在安全关键的临床应用中构成了严重风险。在本研究中,我们使用 MedMCQA 基准进行系统敏感性分析,以评估通用(例如 GPT-3.5、Llama3)和医疗专用 LLM(例如 ClinicalBERT、BioLlama3、BioBERT)的稳健性。我们将扰动分为自然扰动和对抗性扰动,并检查它们对临床推理任务中模型一致性、准确性和可靠性的影响。我们的研究结果表明,医用 LLM 本质上并不安全。即使措辞上的微小变化也可能改变临床建议,而有针对性的对抗性提示可能会引发有害的输出。在医疗保健等高风险环境中,这种不可预测性是不可接受的——临床医生无法可靠地信任因改写输入或稍加改写而产生幻觉药物而改变诊断的模型。虽然模型往往对简单的词汇替换或释义表现出弹性,但它们经常在句法重新排序或误导性上下文提示下崩溃。这种脆弱性在通用和特定领域的 LLM 中都很明显。值得注意的是,对抗性操作可能会导致临床上危险的结果,例如推荐不正确的剂量或忽略关键发现。