RefusalBench:为什么拒绝率在生物研究提示中对前沿 LLM 进行错误排名
RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts
摘要
Frontier 大语言模型 越来越多地被部署为生物研究工作流程的编排骨干,但不存在共享证据基础来比较它们对合法研究提示的拒绝行为。这里介绍的 RefusalBench 是 47 个包中 141 个提示的匹配三重基准,它保持任务框架不变,同时仅改变生物风险等级(良性、边缘、双重用途),从而实现对子域混杂具有鲁棒性的分层条件比较。 15 个提示“应该拒绝”正控制模块建立每个模型的校准底线;三个模型甚至无法拒绝这些提示。在 2026 年 5 月快照中的 19 个前沿模型中,对于相同的提示,严格拒绝率在 0.1% 到 94.6% 之间。在此快照中,管辖权不会预测拒绝(Mann-Whitney U,p = 0.393;欧盟 n = 1,美国双峰);提供商身份确实如此,Anthropic 的 API 堆栈预测拒绝率为 OR = 21.03(95% CI:提示集群为 14.58-30.34;模型集群 GEE 为 5.70-77.55)。这种效果最好理解为访问路径级别而不是模型权重级别:99.8% 的 Anthropic 严格拒绝都带有相同的 safety_policy 裁定原因代码,与一小部分规范拒绝模板一致,而不是逐例模型推理。严格的拒绝率导致安全校准排名错误:Grok 4.20 实现了最高的级别区分度(Youden's J = 0.787),但总体拒绝率仅排名第七,而 Claude Opus 4.7 的 J 较之前版本下降了 65%,且在两用检测方面没有任何改进。 18 个前沿模型中有 9 个在双重用途层表现出对冲但帮助的部分合规模式,而二进制拒绝指标无法检测到。