论文

论人工智能时间范围的估计和有效性——METR图的统计观察

On the estimation and validity of AI time horizons---a statistical look at the METR plot

模型评测智能体系统Agent任务评测评测方法与指标

摘要

METR 的 50% 时间范围衡量了人工智能以 50% 概率解决的软件任务的人类完成时间,从而允许人工智能能力以可解释的单位来表达。在 228 个任务和 26 个 AI 上,我们使用样条曲线和项目响应理论重新计算时间范围,以放宽任务的 AI 难度线性依赖于人类时间对数的假设。我们的拟合样条可以解释为将人类时间转换为人工智能难度的函数;在 2--30 分钟的区域几乎持平,但在其他地方接近线性。因此,尽管乘数相同,从 3 分钟到 30 分钟比从 30 分钟到 5 小时要容易得多。总体而言,我们提供了在经过交叉验证的适当评分规则套件下表现更好的时间范围点估计,以及用于评估时间范围的构造有效性的诊断图。我们建议将时间范围与诊断图一起解释,特别是当提出新的基于时间范围的基准或现有基准逐渐包含更长的任务时。