论文
WHBench:通过女性健康主题的专家在环验证来评估 Frontier LLM
WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics
摘要
大语言模型越来越多地用于医疗指导,但在基准设计中女性健康仍然被低估。我们推出了女性健康基准 (WHBench),这是一套有针对性的评估套件,包含 10 个女性健康主题的 47 个专家设计的场景,旨在揭示具有临床意义的失败模式,包括过时的指南、不安全的遗漏、剂量错误和与公平相关的盲点。我们使用 23 个标准评估 22 个模型,涵盖临床准确性、完整性、安全性、沟通质量、指令遵循、公平性、不确定性处理和指南遵守情况,并进行安全加权处罚和服务器端分数重新计算。在 3,102 项尝试回答(3,100 项评分)中,没有模型平均表现超过 75%;最好的模型达到72.1%。即使是顶级模型,完全正确率也很低,而且危害率差异很大。评估者间的可靠性在响应标签级别上中等,但在模型排名上较高,支持 WHBench 实用程序进行比较系统评估,同时强调临床部署中专家监督的需要。 WHBench 提供了一个公共的、故障模式感知的基准,以跟踪女性健康人工智能领域更安全、更公平的进展。