论文

不可预测的安全性:领域相关的合规性和开放权重中的透明度差距 LLM

Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs

模型评测安全与风险评测

摘要

我们提出了开放权重 LLM 中领域相关安全行为的系统研究:跨 7 个道德领域的 7 个标准化实验,在 4,200 次交互中测试 5 个模型 (12B--70B),并进行双法官验证。使用双条件方法,在分析框架(识别危害)和操作框架(帮助实施危害)中测试每个场景,我们发现合规率从 14.7%(人口贩运)到 85.7%(监视设计)不等,跨度为 71 个百分点,且集群引导的 95% CI 不重叠。值得信赖的部署需要可预测的安全行为,但我们发现合规性高度依赖于上下文:同一模型 (Mistral Nemo 12B) 在 100% 的请求中提供监视设计,但仅协助 26.7% 的贩运。这种不可预测性对于部署人员来说是不透明的:技术框架旁路,将有害请求重新构建为工程问题,凌驾于安全训练之上,而没有任何外部信号表明拒绝阈值已发生变化。域内异质性达到84.4pp,这意味着即使在域级别也无法预测安全行为。通过 GitHub Copilot CLI 部署产品表面访问的五个前沿封闭模型(GPT-4.1/5.2、Claude Haiku/Sonnet/Opus 4.x;n=4,163 个响应)的复制重现了相同的域分层,绝对级别减弱但形状相同,其中两个低编码域(科学欺诈、监视)再次是最宽松的。这些结果表明,当前的安全机制缺乏可信人工智能部署所需的透明度和一致性。