论文

CLEAR:揭示噪声和模糊性如何降低医学 LLM 的可靠性

CLEAR: Revealing How Noise and Ambiguity Degrade Reliability in LLMs for Medicine

模型评测鲁棒性、公平性与可信度评测

摘要

医学 大语言模型 (LLM) 评估依赖于简化的考试式基准,很少反映现实世界医学查询的模糊性。我们引入了模糊性和可靠性临床评估 (CLEAR) 框架,该框架评估决策空间表示、模糊性和不确定性如何影响 LLM 在医学基准上的推理。 CLEAR 系统地扰乱 (1) 合理答案选项的数量,(2) 真值 或弃权选项的存在,以及 (3) 答案选项的语义框架。将 CLEAR 应用到 17 个 LLM 评估的三个基准上,揭示了现有评估方法的三个显着局限性。首先,增加合理答案的数量会降低模型识别正确答案并避免错误答案的能力。其次,随着弃权的框架从“以上都不是”等断然拒绝转变为“我不知道”(IDK) 等不确定性承认,这种缺乏谨慎的情况会加剧。值得注意的是,仅在答案空间中包含 IDK 会增加错误的答案选择。最后,我们将识别正确答案和避免错误答案之间的性能差距正式化为谦逊缺陷,这种缺陷随着模型规模的扩大而恶化。我们的研究结果揭示了标准医疗基准的局限性,并强调仅靠扩展并不能解决 LLM 可靠性问题。