论文

智能体的期末考试

Agents' Last Exam

智能体系统Agent任务评测

摘要

最近的人工智能系统在广泛的基准测试中取得了强劲的成果,但这些成果并没有转化为在许多专业领域具有经济意义的部署。我们认为,这种差距很大程度上是一个评估问题:广泛使用的基准缺乏对真实且具有经济价值的工作流程的持续性能衡量。本文介绍了智能体最后考试 (ALE),这是一个基准,旨在评估人工智能智能体的长期、经济价值、现实世界任务以及可验证的结果。 ALE 与 250 多名行业专家合作开发,涵盖参考 O*NET / SOC 2018(美国联邦职业分类法)定义的非实体行业。它围绕任务分类法进行组织,包含 55 个子领域,分为 13 个行业集群,涵盖 1K+ 任务。目前的结果表明,最难的层仍远未饱和:在主流Harness和主干配置中,平均完全通过率低于 1%。 ALE 被设计为一个活生生的基准:随着新的工作流程和行业的加入,它的任务池不断增长。更广泛地说,ALE 不仅旨在作为另一个排行榜,而且作为缩小基准成功与 GDP 相关影响之间差距的工具。

智能体的期末考试:论文配图
图 1:代理的最后考试涵盖了专业任务和实际工作流程的广泛分类。