论文

MHSafeEval:大语言模型 中心理健康安全的角色感知交互级评估

MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

模型评测安全与风险评测

摘要

大语言模型 (LLM) 越来越多地被探索作为心理健康咨询的可扩展工具,但由于临床伤害的相互作用和情境依赖性,评估其安全性仍然具有挑战性。现有的评估框架主要使用粗粒度分类法或静态数据集来评估孤立的反应,限制了它们诊断危害如何在多轮咨询互动中出现和累积的能力。在这项工作中,我们介绍了 R-MHSafe,一种角色感知的心理健康安全分类法,它根据人工智能顾问所采取的互动角色来描述临床上的重大伤害,包括肇事者、煽动者、协助者或推动者,并结合临床基础的伤害类别。然后,我们提出了 MHSafeEval,这是一个基于代理的闭环评估框架,该框架将安全评估制定为通过对抗性多轮交互,在角色感知建模的指导下,在轨迹级发现危害。使用 R-MHSafe 和 MHSafeEval,我们对最先进的 LLM 进行了大规模评估。我们的结果揭示了现有静态基准系统地错过的大量依赖于角色和累积的安全故障,并表明我们的框架显着提高了故障模式覆盖率和诊断粒度。