论文

VeriSim:在真实患者噪声下评估医学AI的可配置框架

VeriSim: A Configurable Framework for Evaluating Medical AI Under Realistic Patient Noise

模型评测鲁棒性、公平性与可信度评测

摘要

医学大语言模型(LLM)在标准化基准上取得令人瞩目的性能,但这些评估无法捕捉真实临床问诊的复杂性——患者会表现出记忆缺口、健康素养有限、焦虑及其他沟通障碍。我们提出VeriSim,一个保持真实的患者模拟框架,它向患者响应注入可控且有临床证据支撑的噪声,同时通过UMLS-LLM混合验证机制严格遵循医学真实值。我们的框架将源自同行评审医学沟通文献的六个噪声维度操作化,捕捉真实的临床现象,如患者回忆局限、健康素养障碍和病耻感驱动的隐瞒。跨七个开放权重LLM的实验表明,所有模型在真实患者噪声下都显著退化,诊断准确率下降15%-25%,对话长度增加34%-55%。值得注意的是,较小的模型(7B)比较大规模模型(70B+)的退化程度高出40%,而在标准语料上做医学微调对抵御患者沟通噪声的鲁棒性收益有限。执业认证临床医生的评估证明了模拟的高质量以及强评估者间一致性(kappa > 0.80),而LLM-as-a-Judge可作为经验证的辅助评估器,在可扩展评估中达到相当的可靠性。我们的结果凸显了当前医学AI中一个关键的Sim-to-Real差距。我们将VeriSim作为开源噪声注入框架发布,为评估临床鲁棒性建立了严格的试验平台。

VeriSim:在真实患者噪声下评估医学AI的可配置框架:论文配图
图 1:模拟与真实的差距:同一患者病例(45F,心肌梗塞)根据沟通方式不同会产生不同的结果。左:理想化的患者可以在 6 个回合内实现正确的诊断。右图:具有记忆力、识字能力和社会文化噪音的现实患者 (VeriSim) 在 14 轮后导致误诊。