论文
用于医疗安全性、稳健性和公平性评估的多领域红队框架 大语言模型
A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models
摘要
大语言模型 (LLM) 越来越多地部署在医疗保健领域,但现有基准无法捕获临床实践中常见的对抗性或道德复杂条件下的模型行为。我们开发了一个多领域红队框架,评估 11 个当代 LLM,跨越 9 个领域和 150 多个子类别的 690 个临床场景。场景结合了对抗性转换,并使用七维评分标准以及 LLM 辅助评分和人机交互验证来评估响应。结果显示,性能差异很大,平均得分在 0.791 到 0.984 之间。至关重要的是,几个高性能系统在个别安全关键场景中产生了完全失败,这表明总体准确性掩盖了具有临床意义的风险。性能最高的系统(X-BAI、GPT-5、Claude Opus 4.1)得分高于 0.97,方差较低,但不同领域的性能差异很大。与股权相关的任务显示,随着人口统计变化,误差放大了 10-20%,人工审核人员发现了自动评估遗漏的临床相关失败。我们的研究结果表明,性能差异和最坏情况的故障比单独的平均准确度提供了更多具有临床意义的可靠性指标,并且将自动化与临床医生监督相结合的混合评估方法对于可靠的安全评估至关重要。