论文

BRIDGE:从模型性能预测人类任务完成时间

BRIDGE: Predicting Human Task Completion Time From Model Performance

模型评测评测方法与指标

摘要

评估AI系统的真实世界能力,需要将基准性能锚定在人类可解读的任务难度度量上。依赖直接人类任务完成时间标注的现有方法成本高、噪声大,且难以跨基准扩展。在本工作中,我们提出BRIDGE,一个统一的心理测量学框架,它从模型响应中学习潜在难度量表,并将其锚定到人类任务完成时间。利用双参数逻辑斯蒂项目反应理论(IRT)模型,我们从多个基准上的模型性能数据中联合估计潜在任务难度与模型能力。我们证明,潜在任务难度与人类完成时间的对数呈线性变化,从而可以仅凭模型性能为新基准推断人类任务完成时间。借助这一对应关系,我们以人类任务长度为单位预测前沿模型能力,并独立复现了METR的指数缩放结果,即50%可解决任务的时间范围大约每6个月翻一番。