论文
部署决策可靠性:用概化理论为长程Agent评测确定规模的框架
Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations
摘要
企业从业者阅读智能体排行榜时,仿佛它们在对智能体能力进行排序。我们在三个开放的Agent轨迹基准(TheAgentCompany、τ²-bench和AppWorld)上表明:Agent主效应在每个数据集和每种检查类型中占总方差不足3%,而Agent与任务的交互占7-23%。排行榜排的是专长化,而非能力。我们通过四侧面的概化理论(Generalizability Theory)方差分解得出这一结论,并用三种估计器(Henderson Method-I、经lme4的REML和贝叶斯二项GLMM)拟合,三者在小数点后三位一致。另外四项发现进一步揭示排行榜隐藏了什么。第一,总体可靠性在最难任务四分位上崩溃:τ² action_checks上的Eρ²从0.752跌至0.000。第二,训练格可靠性与留出格可靠性负相关(τ²上r=-0.90),意味着看起来最可靠的设计复制效果最差。第三,总体层面的诊断可跨企业基准迁移(能力差距比率稳定在0.35-0.40),但各Agent家族的排名会反转。第四,在MAST失败分类法上,轨迹层面的模式剖面是个性化的(MAE=0.261),而格层面的剖面可泛化(MAE=0.056,r=0.83)。我们将这些打包为Deployment Decision Reliability(DDR),一种一页式报告规范,把方差成分表转化为企业采购方可辩护的五项决策。所有代码、数据加载器和拟合产物均以开源许可发布。