论文
医疗LLM压力审计揭示潜在安全病理
Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy
摘要
大型语言模型 (LLM) 正在进入基于基准准确性的临床实践,但可能无法检测与安全相关的故障模式。在这里,我们提出了 AI-MASLD,这是一个压力审核框架,它将代谢压力测试的逻辑从肝病学应用于临床大语言模型的评估。我们使用 6 个叙事扰动探针的 240 个临床病例,对 7 个模型进行了双压力测试,并通过三个指标量化了性能:代谢指数 (MI)、扰动翻转率 (PFR) 和反事实公平指数 (CFI)。在干净的基线条件下,所有模型均表现良好。在现实叙事压力下,表现出现巨大差异,揭示出两种不同的压力反应表型。量化模型表现出伪标准化,其中低翻转率隐藏了功能崩溃。医学监督微调系统地降低了逻辑稳定性、公平性和信息提取。开放式重量模型在每个安全维度上都匹配或超过了专有替代方案。这些发现将叙述压力审核确立为基于准确性的评估的必要补充。