论文

同一个病人,不同的说法,不同的诊断?评估临床中的语义稳定性 LLM

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地应用于临床应用。然而,他们的行为对微妙的语言变化仍然高度敏感,例如改写或句法变化。这种敏感性在安全关键的医疗保健环境中带来了风险,在这些环境中,语义等效的输入应该产生一致的预测。然而,一个关键的挑战是确保即时变化真正保留临床意义,因为基于嵌入的相似性度量通常无法捕获涉及否定、暂时性或严重性的区别。为了解决这一限制,我们提出了一种基于自然语言推理(NLI)的语义验证框架来过滤保留意义的提示变化,并使用 LLM 作为法官进一步细化并由临床专家审核。此外,我们引入了三个指标来量化模型敏感性:意义保留变异敏感性(MVS)、置信度变异(ΔC)和最坏情况不稳定性(WCI)。我们使用从 DiagnosisQA 和 MedQA 数据集导出的重新制定的提示,评估了相同模型系列和参数范围内的 16 个开源通用 (GP) 和医学 LLM。我们的结果表明,特定领域(DS)模型之间的稳健性差异是混合的并且高度依赖于模型,即领域专业化并不能始终如一地提高或降低保留意义的提示重新表述的稳健性。一些 DS 模型名列最稳健的模型之列(与 GP 模型相比),并且强大的 GP 基线也仍然具有竞争力。