论文
信息缺失下评估医疗AI:同厂商裁判与人类评分改变表面安全性
Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety
摘要
医疗AI的就绪压测一直聚焦封闭式与多模态基准。我们把它扩展到信息缺失下的开放式临床对话——安全行为意味着识别缺失信息并作限定、澄清或不越权承诺——此时评估者本身成为测量的一部分。我们对四个模型压测:三个旗舰(Claude Opus 4.8、GPT-5.5、Grok 4.3)与一个中档模型(Gemini 3.5 Flash),方法是在HealthBench对话中删除最后用户轮的后半段,以四厂商LLM裁判团与盲法临床医生锚定参照评分。两个关于评估者的结果稳健。第一,裁判选择实质改变表面安全性:裁判间一致仅中等(Fleiss' kappa=0.65),在调整各裁判的普遍宽大倾向(投票级逻辑回归)后,同厂商正关联仍存在(精确置换p=0.04;GPT-5.5概率尺度约+0.10)——大到足以在排除自厂商裁判后改变“哪个模型最少越权承诺”的结论。第二,在盲法50项子样本上,LLM裁判比临床医生更宽大:全部四个都比更严格的独立临床医生显著宽大(在66–84%的项目上认可恰当的不确定性,临床医生为52%),四分之三比受作者影响的共识更宽大(Grok仅方向一致;裁判对共识kappa=0.20–0.43)。在作者审计的临床欠定子集上,宽大差距扩大、点估计模型排序保持。封闭式MedQA锚点确认准确率高、选项顺序效应在四个模型中三个处于±5分等价区内——安全差距关于校准而非知识。我们发布压测环境、提示、逐项输出、裁判团、扰动审计与人工标注协议。