论文

将一致性作为可检验属性:评估AI智能体可靠性的统计方法

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

模型评测评测方法与指标

摘要

本文为AI智能体可靠性建立了一套严谨的测量科学,提供了在语义保持扰动下量化一致性的基础框架。通过利用U统计量刻画输出级可靠性、基于核的度量刻画轨迹级稳定性,我们为在多样运行条件下评估智能体提供了一种有原则的方法。我们的提议凸显了智能体核心能力与执行鲁棒性之间的重要区别,表明尽管智能体具备完成任务所需的知识,细微的任务级变化也可能诱发彻底的策略崩溃。我们通过在三个智能体基准上的大量实验验证该框架,证明轨迹级一致性度量相比传统pass@1率提供远高的诊断敏感度。通过提供可定位智能体在何处以及为何偏离的数学工具,我们使识别并纠正阻碍智能体在高风险真实环境中部署的架构性问题成为可能。

将一致性作为可检验属性:评估AI智能体可靠性的统计方法:论文配图
图 3:左:平均编辑位置与(指数 - 未加权)分数。高于零的点表示前载不一致;低于零的点表示回载的不一致持续到提交的执行中。右:平均编辑位置与(指数 - 线性)分数。所有点都低于零,证实指数普遍比线性更严格。对于前载运行,差距最大,并随着编辑位置接近 0.5 而关闭。