论文

VERA-MH:开源人工智能安全评估在心理健康方面的可靠性和有效性

VERA-MH: Reliability and Validity of an Open-Source AI Safety Evaluation in Mental Health

模型评测安全与风险评测

摘要

现在,数百万人使用领先的生成式人工智能聊天机器人来获得心理支持。尽管在可用性和规模方面做出了承诺,但人工智能在心理健康方面最紧迫的问题是这些工具是否安全。最近提出了心理健康中道德和负责任的人工智能验证(VERA-MH)评估,以满足对基于证据的自动化安全基准的迫切需求。本研究旨在检验 VERA-MH 评估人工智能安全性在自杀风险检测和应对方面的临床有效性和可靠性。我们首先模拟了基于大语言模型 (LLM) 的用户(用户代理)和通用人工智能聊天机器人之间的大量对话。获得许可的心理健康临床医生使用评分标准(评分指南)对模拟对话的安全和不安全聊天机器人行为以及用户代理的真实性进行独立评级。一位大语言模型法官使用相同的评分标准来评估同一组模拟对话。然后,我们比较了(a)个体临床医生和(b)临床医生共识和大语言模型法官之间的评级一致性,以及(c)检查了临床医生对用户代理现实性的评级。各个临床医生的安全评级普遍一致(机会校正的评估者间信度 [IRR]:0.77),从而建立了黄金标准的临床参考。大语言模型法官在总体上和关键条件下与这一临床共识(IRR:0.81)强烈一致。临床医生评估者普遍认为用户代理是现实的。为了实现人工智能聊天机器人潜在的心理健康益处,对安全的关注至关重要。这项人体评估研究的结果支持了 VERA-MH 的临床有效性和可靠性:一种开源、全自动的人工智能心理健康安全评估。进一步的研究将解决 VERA-MH 的普遍性和稳健性。