论文
ExplorationBench:在可验证外星世界中度量AI系统的探索能力
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
摘要
科学发现始于已知问题的尽头。在那里,AI系统必须进行探索:提出假设、设计实验并根据结果迭代。然而评估这种能力很困难:(1)如何验证一个真正新颖的假设是否成立;(2)如何判断系统是通过探索发现了它,还是仅仅从预训练数据中回忆了相关知识。为此,我们提出ExplorationBench,它将评估科学探索这一棘手问题转化为建立在可验证外星世界之上的具体且可处理的框架:外星世界的规则是可执行的,因此每个答案都能被精确检验;它们与熟悉知识相冲突,因此仅靠回忆无法解决任务。该基准包含两个沙箱:AlienCode(31个发现目标、70个任务)和AlienLogic(24个发现目标、70个任务)。每个沙箱提供一份有缺陷的手册、任务特定的环境反馈和专用的工具调用模式。系统利用这些资源探索沙箱,然后解决留出的任务。我们评估了10个AI系统,发现最强的系统能够习得并应用陌生规则,但性能在不同轨迹间差异显著,且持续探索可能停滞甚至逆转先前收益。ExplorationBench朝着能够通过探索在未知环境中习得并应用真正新知识的AI系统迈出了一步。
