论文

语言模型抑郁评分更多反映评估者还是患者?

Language-model ratings of depression reflect the rater more than the patient

模型评测鲁棒性、公平性与可信度评测

摘要

抑郁症没有诊断性血液检查。语言模型保证了不懈、一致的评估,但准确的评估者可以对个人提出不同意见吗?我们预先注册了 880 名语言模型评分员,跨越了 11 个带有提示和评分选择的开放模型,并将其应用于 189 项针对八项患者健康问卷的访谈。模型选择解释了 30.0% 的症状总分方差,稳定参与者差异解释了 10.5%。平均而言,接受者操作特征曲线下面积 (AUC) >= 0.70 的两名随机抽取的评估者对 40% 参与者的筛选决策存在分歧。平均高估人数决定了被标记的人数,但同等能力的评估者对大约五分之一的参与者做出了不同的选择。对 86 份新访谈的锁定分析再现了预先登记的主要调查结果。对 40 名有标签的参与者进行探索性重新校准,将准确性从约 60% 提高到 75%,并将分歧减少了一半,五分之一的参与者做出了不同的决定。校准修复了大部分评估者依赖性,但没有获得个人同意。

语言模型抑郁评分更多反映评估者还是患者?:论文原图
扩展数据 图 1:格式合规性和额定严重性。 a,每个模型放置在答案选项上的中值概率,按措辞(参与者观点)。 b,按型号和措辞划分的平均预期项目总和;自我报告的平均值 PHQ-8 在小组标题中给出。 c,按模型和答案格式计算的平均预期项目总和。