论文
更好地评估 LLM 在临床错误检测方面的性能
Toward Better Assessment of LLMs' Performance in Clinical Error Detection
摘要
自动检测临床文档中的错误是 大语言模型 (LLM) 的一个有前景的应用,但部署此类模型的决策取决于单独评估每个临床记录的基准。错误检测基准通常是通过将错误注入音符来构建的,这样每个错误的音符都有一个自然的对应物。聚合判别性指标(例如,平衡准确度或 F1)不会利用此结构。我们证明这种遗漏是必然的。特别是,在跨 3 种语言的 4 个标准化临床错误检测测试集上评估 15 个不同的 LLM 时,我们发现 15 个模型中有 13 个低于随机成对歧视的水平,即使达到了标准实践认为中等的 F1 分数。我们还观察到,不同语言的潜在偏差模式有所不同:同一模型可以在一种语言上默认为“无错误”,而在另一种语言上则过度标记错误。为了诊断歧视在哪里失效,我们进一步引入了一个对模型输出中引用的证据进行评分的程序。我们发现,虽然模型一致地定位与错误相关的内容,但它们无法对干净的对应内容产生相应的正确判断。最后,我们表明 F1 和成对准确率是由相同的潜在偏差向相反的方向驱动的,因此 F1 的排序模型可以系统地提升最弱的判别器。对于安全关键的临床 NLP 应用,我们主张在基准报告中通过配对评估来补充总体指标。代码和分析脚本可在 https://github.com/healthylaife/paired-clinical-eval 获取。