论文
拒绝、分解与刷新:闭环AI评估中的审慎结论协议
Refuse, Decompose, Refresh: A Claim-Safe Protocol for Closed-Loop AI Evaluation
摘要
一次AI评估即使完全可复现,仍可能支持错误结论。闭环系统中这一风险尤其突出:策略决定访问的状态、可观测组件以及哪些失败留下可测量痕迹。我们提出包含三个动作的审慎结论协议。拒绝:当干净参考流或匹配运行时对比缺乏支持时不作判断。分解:将协议执行、运行中的错误接纳和结构性假设分别报告,而不是压缩成一个通过或失败标签。刷新:把分布变化告警视为使参考映射失效并重新计算的请求,而不是故障证据。我们在只提供聚合数据的模拟器中实现协议,覆盖24个策略组件、三种需求状态、两类故障掩码,以及独立的开发和留出随机种子。预注册留出集包含1,440个案例与21,600行分区数据。72个状态—组件单元中只有55个获准进入参考评估,其中54个在运行时仍可接纳,使拒绝判断本身成为结果的一部分。对20个有代表的组件,稳定错误接纳为0/20,在冻结的0.20规则下,单侧精确95%上界为0.1391。在获准单元内,受影响的干净流量比名义故障单元比例更能预测结果:20个组件簇内嵌套的540行单元—实验组数据中,以单元比例减去流量的负对数似然差为每行0.1264纳特,95%组件聚类区间为[0.0593,0.1918]。漂移日志说明“无故障”必须相对于参考定义:三种状态下,干净无故障数据流分别触发15/15、0/15和14/15次告警,只有中间状态符合冻结的检测器参考。我们贡献的不是通用阈值,而是连接可观测支持、统计校准和有依据结论的可执行契约。