论文

MLS-Bench:对人工智能系统进行全面、严格的评估,以构建更好的人工智能

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

模型评测基准与评测资源

摘要

现代人工智能的进步是由机器学习方法推动的,这些方法可以跨环境推广并扩展到更大的体系。随着 大语言模型 在推理、编码和工程任务方面展示出先进的能力,了解他们是否能够发现这些方法而不是仅仅应用现有的方法变得越来越重要。我们引入了 MLS-Bench,这是一个评估人工智能系统是否能够发明可推广和可扩展的机器学习方法的基准。 MLS-Bench 包含跨 12 个领域的 140 项任务,每项任务都要求代理改进 ML 系统或算法的一个目标组件,并证明该改进可以跨受控设置和规模推广。我们发现,当前的智能体还远远没有可靠地超越人类设计的方法,并且工程风格的调整对它们来说比真正的方法发明更容易。我们进一步研究测试时间扩展、自适应计算分配和上下文提供对代理发现性能的影响,以及其行为的案例研究。我们的分析表明,瓶颈不仅在于提出新方法,还在于规划、验证和扩展有关这些方法的主张所需的科学洞察力。仅靠更多的搜索、计算或上下文并不能消除这个瓶颈。我们构建和维护一个用于累积和可比迭代的社区平台,并在 https://mls-bench.com 上发布数据和代码。