论文

探寻开放性的构成要素:用大型视觉语言模型复现Picbreeder

In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models

智能体系统Agent任务评测

摘要

我们正处于大规模的工业与学术努力之中,试图通过AI驱动的助手自动化科学、技术与创意生产的过程。从历史上看,这些过程在其人类形态下的一个根本属性是开放性(open-endedness):即产生看似无穷无尽的新颖且有意义的新形式的能力。人工智能体是否具备这种富有成果的无引导发现能力?为回答这一问题,我们转向Picbreeder——人类驱动的开放式搜索的典范实例,其中用户通过小型神经网络的交互式进化协作生成了一个多样的图像库。我们复现了Picbreeder,用前沿视觉语言模型(VLM)取代人类用户。我们观察到本系统的输出与历史上的人类基线之间存在清晰的定性差异,并尝试用系统发育复杂度、视觉与语义显著性及新颖性等指标来刻画这些差异。为找出促成这些差异的部分因果因素,我们研究了在智能体选择过程中加入探索性噪声、在智能体之间加入行为多样性,以及以过往动作记忆形式加入叙事动量所产生的影响。我们的代码已在 https://github.com/smearle/picbreeder-vlm 开源。