论文

分解 HealthBench 中的医生分歧

Decomposing Physician Disagreement in HealthBench

模型评测评测方法与指标

摘要

我们分解 HealthBench 医疗 AI 评估数据集中的医生分歧,以了解方差位于何处以及哪些可观测特征可以解释它。评分细则身份解释了 15.8% 的达成/未达成标签方差,但仅解释 3.6-6.9% 的分歧方差;医生身份仅解释 2.4%。占主导的 81.8% 案例级残差无法被 HealthBench 的元数据标签(z = -0.22,p = 0.83)、规范性评分语言(pseudo R^2 = 1.2%)、医学专科(Tukey 配对 300 对中 0 对显著)、表面特征分诊(AUC = 0.58)或嵌入(AUC = 0.485)所降低。分歧随完成质量呈倒 U 形(AUC = 0.689),证实医生对明显好或差的输出意见一致,而对边界案例意见分裂。经医生验证的不确定性类别显示,可还原的不确定性(缺失上下文、表述含糊)使分歧几率翻倍以上(OR = 2.55,p < 10^-24),而不可还原的不确定性(真正的医学模糊性)无影响(OR = 1.01,p = 0.90),尽管即便是前者也仅解释约 3% 的总方差。因此,医疗 AI 评估中的一致性上限在很大程度上是结构性的,但可还原/不可还原的分离表明,弥合评估场景中的信息缺口可以在固有临床模糊性无法做到之处降低分歧,指向可操作的评估设计改进。