论文
将一致性作为可检验属性:评估AI智能体可靠性的统计方法
Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability
摘要
本文为AI智能体可靠性建立了一套严谨的测量科学,提供了在语义保持扰动下量化一致性的基础框架。通过利用U统计量刻画输出级可靠性、基于核的度量刻画轨迹级稳定性,我们为在多样运行条件下评估智能体提供了一种有原则的方法。我们的提议凸显了智能体核心能力与执行鲁棒性之间的重要区别,表明尽管智能体具备完成任务所需的知识,细微的任务级变化也可能诱发彻底的策略崩溃。我们通过在三个智能体基准上的大量实验验证该框架,证明轨迹级一致性度量相比传统pass@1率提供远高的诊断敏感度。通过提供可定位智能体在何处以及为何偏离的数学工具,我们使识别并纠正阻碍智能体在高风险真实环境中部署的架构性问题成为可能。
