论文

检查问题:人工智能进入受监管公司之前必须满足什么条件

The Checking Problem: What must be true before AI ships in a regulated firm

模型评测评测方法与指标

摘要

企业人工智能程序停滞不前的速度被广泛引用且解释不清。本文测量了这一机制。在受监管的金融服务中每天执行的六个文档密集型工作流程在四个模型系列和三种工具配置中运行,每种运行三次,在 72 种配置中生成 5,093 个评分输出元素。每个配置都经过两次评估:针对演示条,即在单个案例上的单次正确运行,以及针对生产条,要求持续的准确性、重复的可重复性、可验证的归因以及携带信息的置信度信号。 72种配置中有57种通过了示范栏,32种通过了生产栏,成活率为56.1%。然后,本文计算了每种配置所带来的审查负担,这是根据样本估计的,而不是事后估计的。声明不置信度的工具需要对其输出进行 100% 的审核,因为它无法为审核者提供分类依据。要求工具引用其来源并声明置信度可将其降低至 49%,同时在 20 种配置中的 17 种中保持残余误差容限。添加自验证通行证的延迟是普通配置的 2.3 倍,达到 44%,并且是唯一无法保持容错的配置。实际意义在于,人工智能工作流程的价值与其说是正确的频率,不如说是人类必须检查的程度,而第二个属性是可测量的,但很少测量。