论文

心理健康AI安全测试中的专家评估与人类反馈的局限

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

模型评测评测方法与指标

摘要

从人类反馈中学习(LHF)假定专家判断经适当聚合后,可为训练和评估AI系统提供有效基准真值。我们在心理健康领域检验了这一假设,因为该领域的高安全风险使专家共识至关重要。三位认证精神科医生使用经过校准的评分量表独立评估LLM生成的回答。尽管接受了相似的培训并共享相同的说明,评分者间信度始终较差(ICC 0.087–0.295),低于被认为对重大评估可接受的阈值。分歧在安全最关键的条目上最高。自杀和自伤回答产生的分歧大于任何其他类别,且这种分歧是系统性的而非随机的。一个因素的信度为负(Krippendorff's α = -0.203),表明存在比随机更糟的结构化分歧。定性访谈揭示,分歧反映的是连贯但不兼容的个人临床框架——安全优先、参与中心和文化知情三种取向——而非测量误差。通过证明专家依赖整体性风险启发式而非细粒度的因素判别,这些发现表明聚合标签实际上起到了算术妥协的作用,有效抹除了有专业依据的理念。我们的结果将安全关键AI中的专家分歧刻画为一种社会技术现象,其中专业经验引入了复杂的、有原则的分歧层面。我们讨论了对奖励建模、安全分类和评估基准的影响,建议从业者从基于共识的聚合转向保留并学习专家分歧的对齐方法。