论文
K-Bench:用于评估高风险心理健康对话中的大型语言模型的临床校准基准
K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations
摘要
人们越来越多地使用大型语言模型 (LLM) 来提供心理健康支持,但他们在不断发展的高风险对话中的安全性仍然没有得到很好的描述。我们开发了 K-Bench,这是一个经过临床医生校准的受保护基准,评估 125 个模型配置,代表来自 14 个提供商的 33 个基本模型,涉及 200 个多轮小插图的固定队列,涉及自杀、自残、家庭暴力、药物滥用和无风险演示。合成的患者对话与真实的人类人工智能对话显示出大量的分布重叠。冷冻 GPT-4o 法官对来自 151 份临床医生评级成绩单的 6,751 项合格项目进行比较,与临床医生共识的准确率达到 94.2%。领先模型将强有力的支持性对话与高于 95 的综合风险分数相结合,而风险探索则暴露了表现较低的配置之间的巨大差异。治疗提示产生的特定配置收益集中在较弱的模型中,而高级推理则没有产生平均改善。 K-Bench 将更广泛的临床覆盖范围和配置规模比较与不断更新的公共排行榜相结合,该排行榜的操作测试材料受到直接优化的保护。排行榜可在 www.k-bench.ai 上查看。