论文

逃离一致性陷阱:评估规则治理AI的可辩护性信号

Escaping the Agreement Trap: Defensibility Signals for Evaluating Rule-Governed AI

模型评测评测方法与指标

摘要

内容审核系统通常通过衡量与人工标签的一致性来评估。在规则治理的环境中这一假设失效:多个决策可能在逻辑上都符合治理政策,而一致性指标会惩罚有效决策并将歧义误判为错误——我们将这种失败模式称为一致性陷阱(Agreement Trap)。我们将评估形式化为基于政策的正确性,并引入可辩护性指数(DI)与歧义指数(AI)。为了在不增加额外审核轮次的情况下估计推理稳定性,我们提出概率可辩护性信号(PDS),它源自审核模型的token对数概率。我们将LLM推理轨迹用作治理信号而非分类输出:部署审核模型不是为了判定内容是否违反政策,而是验证某项建议决策能否从治理规则层级中逻辑推导得出。我们在多个社区和评估群组的超过193,000条Reddit审核决策上验证了该框架,发现基于一致性与基于政策的指标之间存在33-46.6个百分点的差距,且模型79.8-80.6%的假阴性对应于符合政策的决策而非真实错误。我们进一步表明,测得的歧义由规则具体性驱动:在相同社区规则的三个层级下审核37,286条相同决策,使AI降低10.8个百分点,而DI保持稳定。重复采样分析将PDS方差主要归因于治理歧义而非解码噪声。基于这些信号构建的治理门控(Governance Gate)实现了78.6%的自动化覆盖率,风险降低64.9%。综合来看,这些结果表明规则治理环境中的评估应从与历史标签的一致性转向显式规则下基于推理的有效性。

逃离一致性陷阱:评估规则治理AI的可辩护性信号:论文配图
图 1:防御性框架。规则层次结构 R=(RG,RC,P)R=(R_{G},R_{C},P) 与内容 CC 和提议的决策 y^\hat{y} 一起流入审核模型 MaM_{a}。 MaM_{a} 生成迹 A=(κ,ω,ι,ψ)A=(\kappa,\omega,\iota,\xi) 并将 y^\hat{y} 分类为 L1(稳健防御)、L2(合理防御)或 L3(不可防御)。 DI 聚合 L1∪L2L_{1}\cup L_{2} 分数;人工智能会聚合反向检查触发的案例。根本原因分类法将分歧分解为模型错误 (19.4%)、隐性规范执行和政策模糊性。