论文
测量前沿AI能力的开放世界评估
Open-World Evaluations for Measuring Frontier AI Capabilities
摘要
基于基准的评估对追踪前沿AI进展仍然重要。但它既可能高估也可能低估已部署的能力,因为它偏爱那些能够被精确定义、自动评分、易于针对性优化、并且能以低预算和短时间范围运行的任务。我们提倡一类互补的评估,称之为开放世界评估:长时程、混乱的真实世界任务,通过小样本定性分析而非基准规模的自动化来评估。本文综述近期的开放世界评估,指出其优势与局限,并介绍CRUX(Collaborative Research for Updating AI eXpectations),一个定期开展此类评估的项目。作为首个实例,我们让一个AI智能体开发一个简单的iOS应用并发布到Apple App Store。该智能体仅在一次本可避免的人工干预下完成了任务,表明开放世界评估能够为可能很快普及的能力提供早期预警。我们最后给出设计与报告开放世界评估的建议。
