论文
MedPRESS:LLM 中患者压力引起的医疗奉承的多轮基准
MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs
摘要
大语言模型 (LLM) 越来越多地用于健康相关建议。现有的研究通过静态问题来衡量他们的安全性,而不是与患者进行有压力的对话。我们在 LLM 中引入了 MedPRESS,这是一个用于测量患者压力引起的阿谀奉承的多轮基准。 MedPRESS 包含 600 个基于医学的五轮对话,涉及三个场景系列:药物和治疗需求、个人健康自我护理以及症状分类和护理阻力。每次对话都以健康问题开始,并通过个人经验、社会证明、外部证据主张和直接对抗性挑战逐步升级。我们使用结构化评审和以安全为中心的指标,评估了通用、医疗领域、轻量级、大型、开放重量和专有系列的 20 个 LLM。结果表明,在反复的患者压力下,模型经常转向不安全的协议,模型家族、模型规模和提示类型之间存在很大差异。反阿谀奉承提示提高了多种模型的稳健性,但并不能消除不安全的协议。 MedPRESS 强调了医学 LLM 评估中的一个关键差距:安全的医学知识是不够的,除非模型能够在对话压力下维持它。