论文

度量超出人类尺度的智能

Measuring Intelligence Beyond Human Scale

模型评测评测方法与指标

摘要

如何度量超出人类能力的智能?人类撰写的基准会饱和,而超出人类能力后,考官可能不知道哪些任务既难又可验证。我们论证该困难是绝对尺度评估所固有的,并提出基于相对测量的新范式:模型生成公开挑战以区分其他系统。聚合这些结果产生可随被测系统扩展的对抗性心理测量评级系统。我们描述降低私有信息攻击激励、支持免裁判裁决、并随智能体能力自然扩展的实用协议。我们在可验证与开放式、不可验证的领域实例化该框架——说明模型生成的评估如何能在人类前沿之外继续度量系统。