论文

HealthBench-Psych:OpenAI HealthBench 的心理健康子集

HealthBench-Psych: A Mental Health Subset of OpenAI's HealthBench

模型评测基准与评测资源

摘要

通用健康基准越来越多地锚定有关 LLM 医疗性能的主张,但它们并不总是由临床专业来解决,使得特定领域的性能难以隔离。心理健康是一个严重的公共卫生问题,因为数百万人向 LLM 寻求心理支持,而且大多数现有评估都是定制的学术基准,很难集成到开发人员工作流程中。我们介绍 HealthBench-Psych 和 HealthBench-Psych-Hard。我们使用透明的 LLM 应用的量规筛选了 HealthBench 的 5,000 条医生与量规对话的心理健康相关性,然后通过两轮盲法临床医生审查和隐藏的已知排除对照来验证该子集,产生 610 条对话(占语料库的 12.2%)。在由三名 LLM 法官组成的跨供应商小组下评估 20 个前沿和开放模型,我们发现统计上相关的前沿集群、两个模型中可测量的拒绝行为以及法官之间几乎相同的排名 ($τ\ge 0.92$)。我们将子集、管道、模型响应、成绩和分析代码作为可重用资源发布。