论文

面向AI智能体持续评估的分布无关不确定性量化

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

模型评测评测方法与指标

摘要

我们将split conformal prediction与自适应保形推断(ACI)应用于AI智能体的持续评估,为预测的质量分数提供分布无关的覆盖率保证。保形区间在24小时视界的所有名义水平上校准误差低于0.02,而ACI在智能体新版本发布后正确地将区间展宽35%随后重新收敛。我们进一步为多智能体流水线开发了组合式不确定性界(通过阶段间相关系数rho在[-0.5, 0.9]范围的仿真加以验证)、面向成对排名且控制错误排名率的保形弃判规则,以及面向排行榜规模多重检验的FDR校正弃判方法。通过每小时采集的18个实时信号对50个智能体进行评估,我们表明每个智能体的条件覆盖率很好地集中于名义水平附近(均值80.4%,90%的智能体位于[72%, 90%]区间内),且跨来源情绪分歧可预测排名的不稳定(r=0.64, p<0.01)。一项控制循环性的验证证实该框架捕获了基准之外的信号(rho_s=0.52, p<0.01, n=35)。代码与数据以CC BY 4.0许可发布。

面向AI智能体持续评估的分布无关不确定性量化:论文配图
图5:保形覆盖率随时域与波动性变化:高波动智能体72小时降至68%(标称80%),促使采用Mondrian分层。