论文

AI 评分者歧视取决于复杂临床决策中的评分协议

AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

模型评测评测方法与指标

摘要

临床 AI 评估越来越多地将评分委托给 大语言模型 (LLM) 作为 AI 评分者,但他们在评估条件下的评分行为尚未得到定量表征。我们通过对成人 2 型糖尿病 (T2D) 药物治疗中 12 个月门诊随访的 AI 评估者行为进行析因研究来解决这一差距,这是一项涉及七个评估问题的复杂决策的临床任务。四个开源 LLM 同时充当临床决策支持系统 (CDSS) 模型和 AI 评估器。每个 CDSS 输出均根据两种评分协议进行评分:包含特定于患者的评分标准的基于评分标准的 Gold Rubric (GR) 协议和无评分标准的非 Gold Rubric (Non-GR) 协议。线性混合效应模型将评分协议因素与五个设计因素交叉——CDSS 模型、CDSS 提示配置(文档引用生成 [DRG] 与基线)、评分者模型、提示字符和提示类型——并估计主效应及其协议交互。在所有问题中,与 GR 相比,AI 评分者在非 GR 下的评分范围非常窄(平均 74--78 分)内始终获得较高的分数(平均分低 7.69 至 49.64 分;四分位数范围宽 1.68 至 3.67 倍)。在每个问题中,GR 将 AI 评估者对 DRG 和基线 CDSS 输出之间的区分放大了 1.76 至 5.10 倍,同时还揭示了非 GR 抑制的评估者模型之间的显着行为差异。这些发现支持将标题锚定作为评分协议,在临床人工智能评估中保留区分能力;当问题需要特定于患者或特定管辖区的标准时,评分者模型无法仅从参数知识中推断出,则无标题评分无法替代。