论文
LLM 遵循他们自己的规则吗?对自我声明的安全政策的反思性审核
Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies
摘要
LLM 通过 RLHF 内部化安全策略,但这些策略从未正式指定并且仍然难以检查。现有基准根据外部标准评估模型,但不衡量模型是否理解并执行其自己规定的边界。我们引入了符号神经一致性审计(SNCA),该框架(1)通过结构化提示提取模型的自述安全规则,(2)将它们形式化为类型化谓词(绝对、条件、自适应),以及(3)通过与伤害基准的确定性比较来衡量行为合规性。对 45 个危害类别和 47,496 个观察结果的四个前沿模型进行评估,揭示了既定政策与观察到的行为之间的系统性差距:声称绝对拒绝的模型经常遵守有害提示,推理模型实现了最高的自我一致性,但未能阐明 29% 类别的政策,而规则类型的跨模型一致性非常低 (11%)。这些结果表明,LLM 所说和所做之间的差距是可衡量的且依赖于架构,从而激发了反思一致性审计作为行为基准的补充。