论文
带随时有效保证的AI系统自适应审计
Adaptive auditing of AI systems with anytime-valid guarantees
摘要
表征生成式人工智能系统故障模式的一个主要瓶颈是注释和评估的成本和时间。因此,自适应测试范式越来越受欢迎,其中人们根据过去的结果机会决定要注释哪些案例以及多少案例。虽然这个框架非常实用,但其极端的灵活性使得很难得出统计上严格的结论,因为它违反了经典假设:观察的数量通常是有限的(通常是 10 到 50 个案例),并且有关采样和停止的决定是在数据收集过程中做出的,而不是基于预先指定的规则。为了描述可以从高度自适应审计中得出哪些统计推论,我们从两个“决斗”角度引入了一个假设检验框架:(i)模型的零值,断言不存在性能低于目标阈值的故障模式;(ii)审计员的零值,断言他们有一个可以发现故障模式的抽样策略。利用安全随时有效推理 (SAVI),我们将审计员正式化为进行“投注测试”,这转化为用于测试对决零假设的同步电子流程。此外,如果审计员足够强大,我们就证明这两个假设是渐进逆的,因为严格审计的通过实际上证明了人工智能系统在全球范围内都是稳健的。根据经验,我们证明我们提出的测试程序可以保持随时有效的 I 类错误控制,优于预先指定的测试方法,并且有时只需 20 个观察即可得出统计上严格的结论。
