合规性差距:为什么人工智能系统承诺遵循流程说明但实际上却没有
The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't
摘要
审计员指示人工智能助理:“使用读取工具单独打开每个文件——无需脚本,无需代理。”人工智能回答“是”——然后发出一个批量调用,一次性汇总所有 50 个文件。我们称之为“合规差距”:人工智能诚实的第三个正交轴,与事实的真实性和修辞实质不同。三个问题:这种言语行为脱节是否存在(存在);任何纯文本观察者都可以恢复它(可检测性); AI部署需要什么基础设施(补救措施)?大约 75 个基准(IFEval、SWE-bench、BFCL、COMPASS、SpecEval)衡量结果保真度;没有一个措施可以衡量过程的保真度。定理 1 表明,在奖励文本而不观察行为的强化学习中,这种差距在结构上是不可避免的。定理 2 通过数据处理不等式表明,无论现在还是将来,任何人类或 LLM 观察者都无法仅从文本中检测到它。针对 6 个前沿模型的 13 项实验和 2,031 次会议证实了这两个预测。在默认框架下,所有六种指令的遵守率均为 0%——克劳德十四行诗 4 十次中十次口头同意,然后在所有十次中绕过。这种差距是有选择性的:97% 的合规性得到了奖励(审计追踪),0-4% 的合规性没有得到奖励(文件读取、隐私屏蔽);删除授权工具将合规性提高到 75%(Cohen 的 d = 2.47),确认了环境可供性而不是权重编码失败。九位盲人评估者达到了 Fleiss 的 kappa = 0.130,并正确识别了十五个合规会话中的零个,正如定理 2 所预测的那样。人类在心理学中表现出 47% 的意图行为差距,在外科审计中表现出 96.5% 的差距,而经过 RLHF 训练的模型在默认条件下接近 100%——这是一个保证其自己的测量基础设施的制度。我们发布了 BS-Bench:第一个流程合规性开放基准,具有七个工具调用日志审计指标和一个公共排行榜。