论文

使用 LLM 作为法官/陪审团,对表现出精神病的用户的模型反应进行可扩展的、经过临床验证的安全评估

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

模型评测安全与风险评测

摘要

通用型 大语言模型 (LLM) 正被人们广泛采用用于心理健康支持。然而,新出现的证据表明,高频使用存在重大风险,特别是对于患有精神病的个体来说,因为 LLM 可能会强化妄想和幻觉。现有的 LLM 在心理健康方面的评估因缺乏临床验证和评估的可扩展性而受到限制。为了解决这些问题,本研究重点关注精神病作为 LLM 安全评估的关键条件,方法是 (1) 制定和验证七个临床医生知情的安全标准,(2) 构建人类共识数据集,以及 (3) 使用 LLM 作为评估者(LLM-as-a-Judge)或采取多数投票来测试自动评估LLM 评委(LLM-as-a-Jury)。结果表明,LLM-as-a-Judge 与人类共识紧密一致(Cohen 的 $κ_{\text{ human} \times \text{gemini}} = 0.75$,$κ_{\text{ human} \times \text{qwen}} = 0.68$,$κ_{\text{ human} \times \text{kimi}} = 0.56$),并且最好的法官的表现略优于 LLM-as-a-Jury(Cohen 的 $κ_{\text{ human} \times \text{jury}} = 0.74$)。总体而言,这些发现对于心理健康背景下 LLM 安全评估中基于临床的、可扩展的方法具有良好的影响。