论文
语言模型抑郁评分更多反映评估者还是患者?
Language-model ratings of depression reflect the rater more than the patient
摘要
抑郁症没有诊断性血液检查。语言模型保证了不懈、一致的评估,但准确的评估者可以对个人提出不同意见吗?我们预先注册了 880 名语言模型评分员,跨越了 11 个带有提示和评分选择的开放模型,并将其应用于 189 项针对八项患者健康问卷的访谈。模型选择解释了 30.0% 的症状总分方差,稳定参与者差异解释了 10.5%。平均而言,接受者操作特征曲线下面积 (AUC) >= 0.70 的两名随机抽取的评估者对 40% 参与者的筛选决策存在分歧。平均高估人数决定了被标记的人数,但同等能力的评估者对大约五分之一的参与者做出了不同的选择。对 86 份新访谈的锁定分析再现了预先登记的主要调查结果。对 40 名有标签的参与者进行探索性重新校准,将准确性从约 60% 提高到 75%,并将分歧减少了一半,五分之一的参与者做出了不同的决定。校准修复了大部分评估者依赖性,但没有获得个人同意。
