论文

Health-ORSC-Bench:度量健康场景下过度拒答与安全完成的基准

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

模型评测基准与评测资源

摘要

大语言模型中的安全一致性对于医疗保健至关重要;然而,对二进制拒绝边界的依赖通常会导致良性查询的“过度拒绝”或有害查询的“不安全合规性”。虽然现有的基准衡量这些极端情况,但它们无法评估安全完成:该模型通过提供安全、高级的指导而不会造成可操作的损害,从而最大限度地提高双重用途或边界查询的帮助的能力。我们推出 \textbf{Health-ORSC-Bench},这是第一个大规模基准,旨在系统地测量 \textbf{Over-Refusal} 和 \textbf{Safe Completion} 医疗保健质量。我们的框架包含 7 个健康类别(例如,自残、医疗错误信息)的 31,920 个良性边界提示,使用带有人工验证的自动化管道来测试不同程度的意图模糊性的模型。我们评估了 30 个最先进的 LLM,包括 GPT-5 和 Claude-4,揭示了一种显着的紧张关系:安全优化模型经常拒绝高达 80\% 的“硬”良性提示,而特定领域模型经常为了实用性而牺牲安全性。我们的研究结果表明,模型系列和规模显着影响校准:较大的前沿模型(例如,GPT-5、Llama-4)比较小或基于 MoE 的模型(例如,Qwen-3-Next)表现出“安全悲观主义”和更高的过度拒绝率,这突显出当前的大语言模型很难在拒绝和合规之间取得平衡。 Health-ORSC-Bench 提供了严格的标准,用于校准下一代医疗人工智能助手,以实现细致入微、安全且有用的完成任务。代码和数据将在接受后发布。 \textcolor{红色}{警告:某些内容可能包含有毒或不需要的内容。}

Health-ORSC-Bench:度量健康场景下过度拒答与安全完成的基准
图1:Health-ORSC-Hard-1K 和 Health-Toxic 上的过度拒绝率与毒性提示拒绝率。结果在 temperature 0.0 下测得。表现最好的模型应位于左上角,即模型拒绝的安全提示最少、拒绝的毒性提示最多。