论文

当禁止变成许可:审核语言模型中的否定敏感性

When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

当用户告诉人工智能系统某人“不应该”采取行动时,系统应该将此视为禁止。然而,许多大语言模型却做了相反的事情:它们将否定指令解释为肯定指令。我们审核了 14 个道德场景中的 16 个模型,发现开源模型在简单否定下支持禁止行为的比例为 77%,在复合否定下为 100%,比肯定框架增加了 317%。商业模型表现较好,但仍呈现 19-128% 的波动。模型之间的一致性从肯定提示的 74% 下降到否定提示的 62%,而且事实证明,金融场景的脆弱性是医疗场景的两倍。这些模式在确定性解码下保持不变,排除了采样噪声。我们提出了案例研究,展示了这些失败在实践中如何发挥作用,提出否定敏感度指数(NSI)作为治理指标,并概述了具有特定领域阈值的分层认证框架。研究结果表明,当前的对齐技术所实现的目标与安全部署所需的目标之间存在差距:无法可靠地区分“做 X”和“不做 X”的模型不应该在高风险环境中做出自主决策。

LLM伦理立场的框架不稳定性:道德困境中否定敏感性的审计
图3. 按模型与领域划分的否定敏感性(NSI/SVI)。色标:绿色(0,鲁棒)到红色(100,脆弱)。模型按来源排序:中国(前 4)、美国(中间 8)、开源(后 4)。金融、军事与商业领域(左列)始终表现出高于医疗与教育领域(中列)的敏感性。Gemini-3-Flash 在所有领域 NSI=0;开源模型在大多数高风险领域达到上限(100)。大热力图矩阵展示三个模型组(中国、美国、开源)在各领域的否定敏感性指数(NSI)。y 轴列出模型,x 轴列出金融、军事、医疗等领域。矩阵按梯度着色,绿色表示鲁棒(低 NSI),红色表示脆弱(高 NSI)。Gemini-3-Flash 在所有类别中全为绿色,而开源模型在高风险领域呈现整块红色。