论文

Agent行为契约II:无需独立性假设的组合可靠性认证

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

智能体系统Agent任务评测

摘要

多智能体系统的组合可靠性界把组件可靠性相乘,这一步由一个条件独立性假设背书——该假设常被陈述却很少被检验。我们检验了它。在一个预注册、对 18,000 次任务由确定性代码评分且无大语言模型裁判的评估中,同一模型的两个实例在双智能体交接中,在任一实例失败的任务上有 90.0% 共同失败(log OR 6.66,95% CI [6.38, 7.00];phi 0.916)。替换为不同模型在全部六组对比中都降低了这种关联;在模型已经不同的前提下再替换不同厂商则没有——这是一个被作为零结果报告的预注册假设。这种误差有方向且对运营者不利:正相关使联合失败率高于独立性乘积,因此恰恰在组件共享同一模型时,冗余被高估。无假设的替代方案往往空洞,而拟合一个依赖模型更糟:我们证明,对拟合模型的泛函构造的 bootstrap 界会随 n 增大而失去对真值的覆盖,其识别差距为 O(1),而 bootstrap 修正仅为 O(n^{-1/2})。数据越多,这样的证书反而越差,且没有任何可见症状。我们给出一个不假设任何依赖结构的有限样本证书:在围绕实测共执行矩的 Bonferroni-Clopper-Pearson 盒子上,对联合分布求解线性规划。该证书是可靠的、对所提供信息是紧的,并在矩族上单调。把十个矩泛函扩充到十四个,使识别区间收窄 85.7%,并将认证下界从 0.2455 提升至 0.4116。配套的 anytime-valid 证书在可选停止下把 I 类错误保持在 0.0471。常见的依赖统计量受边际约束,当被比较的智能体失败率不同时,可能逆转条件之间的表面排序。契约、评分代码、分析脚本和预注册材料均已发布。