论文
为什么人工智能代理会违反规则?框架、背景和社交信号如何塑造合规性
Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance
摘要
规定处罚可以将法律义务转变为有利于违法行为的成本效益计算。我们证明这种执行信息悖论发生在人工智能代理中。大多数人工智能安全评估都会测试模型是否失败;我们用法律和经济学的合规理论作为诊断来问为什么。我们评估了部署为企业采购聊天机器人的 12 种指令调整语言模型。每家公司的系统提示中都给出了涵盖大额采购的环境法规,以及一份供应商名单,其中经过认证的供应商的成本几乎是未经认证的供应商的两倍。我们根据威慑、合法性和表达规律的预测来测试代理,发现每种理论都解释了我们观察到的部分内容。在相同条件下,各个模型的合规性跨越了 46 个百分点,而模型的不同之处在于打破它们的压力:有些模型将法规视为具有约束力,无论其措辞如何,而另一些模型则在低处罚和非命令措辞的情况下,在理论预测的情况下失败了。基准分数和开发人员自己对 后训练 的描述并不能预测模型的下降情况。在所有十二个因素中,财务激励、管理要求、同事成果和员工压力都会导致严重的合规失败。这些代理违反了监管限制,以标准对齐基准无法衡量的方式满足本地用户目标。在系统提示中嵌入规则本身不足以产生合规代理:模型选择本身就是一个治理决策,基准评估不足以满足合规性敏感的部署。