论文

在误导性医学背景下测量 LLM 的认知弹性

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

模型评测安全与风险评测

摘要

大语言模型 (LLM) 现在在医疗执照考试中达到了专家级分数,这鼓励了这样一种假设:高分意味着安全的医疗判断,而患者越来越多地使用它们来获取健康建议。我们证明这个假设是脆弱的:当误导性上下文被注入到 LLM 最初正确回答的问题中时,他们会放弃正确的答案。我们将对抗性背景下保持正确判断的能力称为认知弹性,并引入MedMisBench来衡量它。 MedMisBench 包含 10,932 个医学问题项和 48,889 个误导性上下文选项对,涵盖医学推理、代理能力和患者旅程评估。在 11 种模型配置中,平均准确度从原始问题的 71.1% 下降到重点误导性上下文下的 38.0%,攻击成功率为 51.5%。最具破坏性的注入是正式的、类似规则的捏造:权威框架的谎言达到 69.5% 的攻击成功率,异常中毒声明达到 64.1%。由来自 7 个国家的 14 名成员组成的临床小组在 38.2% 的审查案例中发现了严重的潜在危害。 MedMisBench 暴露了医疗环境中 LLM 评估的结构性盲点:现有基准衡量模型知道什么,但不衡量它们是否在误导性背景下保持正确的医学判断。