论文

ExplorationBench:在可验证外星世界中度量AI系统的探索能力

ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

智能体系统Agent任务评测

摘要

科学发现始于已知问题的尽头。在那里,AI系统必须进行探索:提出假设、设计实验并根据结果迭代。然而评估这种能力很困难:(1)如何验证一个真正新颖的假设是否成立;(2)如何判断系统是通过探索发现了它,还是仅仅从预训练数据中回忆了相关知识。为此,我们提出ExplorationBench,它将评估科学探索这一棘手问题转化为建立在可验证外星世界之上的具体且可处理的框架:外星世界的规则是可执行的,因此每个答案都能被精确检验;它们与熟悉知识相冲突,因此仅靠回忆无法解决任务。该基准包含两个沙箱:AlienCode(31个发现目标、70个任务)和AlienLogic(24个发现目标、70个任务)。每个沙箱提供一份有缺陷的手册、任务特定的环境反馈和专用的工具调用模式。系统利用这些资源探索沙箱,然后解决留出的任务。我们评估了10个AI系统,发现最强的系统能够习得并应用陌生规则,但性能在不同轨迹间差异显著,且持续探索可能停滞甚至逆转先前收益。ExplorationBench朝着能够通过探索在未知环境中习得并应用真正新知识的AI系统迈出了一步。

ExplorationBench:在可验证外星世界中度量AI系统的探索能力:论文配图
图 2:ExplorationBench:系统被给予什么、它可以就此做什么,以及如何评分。(A) 两个可执行的沙盒。AlienCode 有 31 个发现目标,AlienLogic 有 24 个,因此各自附带的说明书存在无论多少先验知识都无法弥补的错误——这些变化必须从证据中发现。(B) 每个系统都从同样的缺陷说明书和同样的固定示例出发,随后运行四轮:自行选择探查操作、在环境中执行,并将结果加入其探索历史。除此之外没有任何信息进入上下文。(C) 在每个里程碑 M(t) 处,系统在无工具条件下接受测试:回答 70 个留出任务,并单独报告它认为自己已发现的规则。轨迹按其终点评分,系统按其最佳完整轨迹评分。