论文

当代理指标衡量不同事物时:对 Praxa AI 管道的循证审计

When Agent Metrics Measure Different Things: An Evidence-Grounded Audit of the Praxa AI Pipeline

模型评测评测方法与指标

摘要

当测量与其标签所暗示的结构不同的结构时,代理评估可以在数字上是正确的。我们对选定的 Praxa AI 实施文件、历史评估工件和操作记录进行回顾性测量审计。尽管门控失败为零,但 139 例离线路由报告仍包含 112 次通过和 27 次失败,因为已知的间隙已明确排除在门之外。无标识符导出表示 8,843 个工具尝试行:8,395 个记录的持续时间和 448 个缺失值。在持续时间中,121 个等于带符号的 32 位最大值,并带有废弃客户端标签;检查的数据库代码限制了已用的生命周期年龄。汇总记录的第 99 个百分位数为 2,147,483,647 毫秒,而服务器观察到的已完成调用的时间为 38,118.31 毫秒。这是层对比,而不是治疗效果。在记录的单轨迹压缩试验中,报告的后续输入减少了 94.39%,但触发和后续调用的减少总计为 46.54%。我们重现描述性计算,通过单独的加权理性算术实现验证 91 个时序统计数据,并执行 13 个评分函数和 12 个分析验证器测试。有限完成界限显示了缺失的持续时间如何在不输入值的情况下限制全行计时语句。该贡献是一个源链接的案例研究和可重用的验证包,用于将门策略、生命周期计时和请求级会计与更广泛的代理性能声明分开。历史提供商运行情况和完整的当前管道未独立复制;总体能力优势和人群水平的统计显着性尚未建立。