论文

人工智能验证的几何结构:从结构盲目性到可重复使用的审核

The geometry of AI validation: From structural blindness to reusable audits

模型评测评测方法与指标

摘要

人工智能系统越来越多地搜索候选答案并部署得分最高的答案。增加搜索会改变错误,因此对一个计算预算的精确评估可能会导致另一预算无法解决。我们将这种信息差距与弥补它的成本联系起来。对于独立的n最佳搜索,聚合可靠性测量仅通过他们观察到的方向来识别部署;当仅审核较小的搜索宽度时,我们得出精确的模糊边界。保留候选排名和真值标签可以实现一种建设性的替代方案:一次审核可以估计高达 N 的所有宽度的可靠性。在已知分数百分位数的情况下,对于 T 真值标签和 M 候选观察值的预期预算,极小最大最坏坐标均方误差尺度为 (1 + log N)/T + N/M,上限为常数。匹配下限允许自适应标签获取,从而确定不同的标签和候选成本是该实验所固有的。明确的设计达到了这个顺序;基于记录的补充程序在没有已知分数分布的情况下提供同时保证。回顾性数学推理和代码生成分析表明了为什么依赖于搜索的验证很重要。在保留的 CodeRM 池中,相对于统一标签,共享审核将 100 个宽度上的 95% 最大错误减少了 58% 和 40%。这些结果将结构模糊性转化为可重复使用验证的定量处方。