论文
面向AI智能体持续评估的分布无关不确定性量化
Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation
摘要
我们将split conformal prediction与自适应保形推断(ACI)应用于AI智能体的持续评估,为预测的质量分数提供分布无关的覆盖率保证。保形区间在24小时视界的所有名义水平上校准误差低于0.02,而ACI在智能体新版本发布后正确地将区间展宽35%随后重新收敛。我们进一步为多智能体流水线开发了组合式不确定性界(通过阶段间相关系数rho在[-0.5, 0.9]范围的仿真加以验证)、面向成对排名且控制错误排名率的保形弃判规则,以及面向排行榜规模多重检验的FDR校正弃判方法。通过每小时采集的18个实时信号对50个智能体进行评估,我们表明每个智能体的条件覆盖率很好地集中于名义水平附近(均值80.4%,90%的智能体位于[72%, 90%]区间内),且跨来源情绪分歧可预测排名的不稳定(r=0.64, p<0.01)。一项控制循环性的验证证实该框架捕获了基准之外的信号(rho_s=0.52, p<0.01, n=35)。代码与数据以CC BY 4.0许可发布。
