论文
当禁止变成许可:审核语言模型中的否定敏感性
When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models
摘要
当用户告诉人工智能系统某人“不应该”采取行动时,系统应该将此视为禁止。然而,许多大语言模型却做了相反的事情:它们将否定指令解释为肯定指令。我们审核了 14 个道德场景中的 16 个模型,发现开源模型在简单否定下支持禁止行为的比例为 77%,在复合否定下为 100%,比肯定框架增加了 317%。商业模型表现较好,但仍呈现 19-128% 的波动。模型之间的一致性从肯定提示的 74% 下降到否定提示的 62%,而且事实证明,金融场景的脆弱性是医疗场景的两倍。这些模式在确定性解码下保持不变,排除了采样噪声。我们提出了案例研究,展示了这些失败在实践中如何发挥作用,提出否定敏感度指数(NSI)作为治理指标,并概述了具有特定领域阈值的分层认证框架。研究结果表明,当前的对齐技术所实现的目标与安全部署所需的目标之间存在差距:无法可靠地区分“做 X”和“不做 X”的模型不应该在高风险环境中做出自主决策。
