论文

IBIB:通过服务路由而不是模型标识符来衡量企业人工智能系统的协议

IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier

模型评测评测方法与指标

摘要

企业部署系统,而不是检查点。可用能力共同取决于重量、服务路线、精度、输出合同和装备,但所有 18 个经过审计的基准均对广告中的模型标识符进行了评分。我们将其视为测量误差,并提供一个可报告的协议。它由三个部分组成。 Gold-Blind 能力绑定预检验证路由是否可以在任何任务到达之前执行评估合约;包含可靠性的首次通过评分规则可将失败保留在评分中,同时将不受支持的能力排除在外;评判在结构上是评分盲的。我们将该协议称为 IB2,并发布其算法、分类表、请求契约和清单模式。它的参考实例、128 个锁定任务和针对文档、电子表格、图表、工具和数据库工作的 987 个断言均保持密封:过程是工件,而不是语料库。跨十一个系统,四个结果。能力可用性是可衡量的:在相同权重上进行的两次完整的单路由运行后来未能通过最终绑定门的不同谓词,而第三次在新运行之前通过了该门。所公布的标识符没有暴露任何限制。歧视并不统一:七个套件中的四个在六系统带下饱和,其分布几乎完全来自受管理的数据库工作和多选项卡连接,因此我们报告间隔支持的解析组,而不是排名;名义五标签输出的四次削减中的两次未能进行多重性调整。服务分组的选择将一个声明的修订和精度从 77.38 移动到 82.54,配对间隔 [0.11,10.60],尽管这些臂在访问模式、评测运行框架版本和服务工具调用解析器方面有所不同,并且评测运行框架版本是我们评估器的属性,而不是任何端点。从分母中排除失败的响应会改变点排序,因此可靠性包含会改变结论,而不是其措辞。