论文

ASI-Bench:在人工超级智能的黎明

ASI-Bench: At the Dawn of Artificial Superintelligence

智能体系统Agent任务评测

摘要

人工超级智能(ASI)要求AI超越对既有知识的掌握,转向探索未知、创造新知识,并把新想法转化为可验证的成果。然而,当今AI系统的能力仍在很大程度上建立在学习、压缩和应用既有人类知识之上。相应地,现有基准主要测试AI能否基于学到的知识给出正确答案,或能否在大量人类指导下完成任务。为此,我们推出ASI-Bench,这是首个在通用研究领域联合评估AI系统创新探索与自主科学执行能力的基准,也是首个在同一研究项目内逐步撤回人类方法论指导、以测试AI仅凭自身能走多远的基准。ASI-Bench由40多位专家构建,耗费31,000+人工小时,包含11个科学领域的60个项目级研究任务,并逐步减少方法论指导,以测试AI能否独立选择方法、开展研究并产出可验证结果。所有任务均经过专家评审、AI辅助审计、沙箱执行与评分器验证。在18个最先进的智能体-模型配置上,平均分从完整方法论指导下的50.91降至仅指定方法时的29.10,再降至须由智能体自行确定方法时的26.62。这一急剧下滑表明,当前系统仍严重依赖人类指导,距离自主开展端到端、项目级科学研究还很遥远。ASI-Bench向全世界开放。我们邀请各地的研究者与建设者贡献新任务,挑战当今AI的极限,助力加速人类迈向人工超级智能的集体征程(https://asibench.apexin.ai/submit)。

ASI-Bench:在人工超级智能的黎明:论文配图
图1:ASI-Bench 概览。左:各智能体在 B3 上的性能。右:B1 至 B4 的得分,其中 B1 提供完整方法,B2 仅提供方法名称,B3 仅提供研究目标与数据,B4 在此基础上加入干扰项。