论文

CreativeBench:通过自进化挑战评测与增强机器创造力

CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges

模型评测基准与评测资源

摘要

高质量预训练数据的饱和已将研究焦点转向能够持续生成新颖成果的进化系统,并促成了AlphaEvolve的成功。然而,此类系统的进展受到严谨定量评估缺失的制约。为应对这一挑战,我们提出CreativeBench,一个基于经典认知框架、用于评估代码生成中机器创造力的基准。该基准由CreativeBench-Combo和CreativeBench-Explore两个子集组成,通过利用逆向工程与自我对弈的自动化流程,分别针对组合型与探索型创造力。借助可执行代码,CreativeBench通过以质量与新颖度乘积定义的统一指标,客观地区分创造力与幻觉。我们对最先进模型的分析揭示了不同的行为:(1) 规模扩展显著提升组合型创造力,但对探索的收益递减;(2) 更大的模型表现出“随规模收敛”(convergence-by-scaling),变得更正确但发散性降低;(3) 推理能力主要受益于受限探索而非组合。最后,我们提出EvoRePE,一种即插即用的推理时引导策略,通过内化进化搜索模式持续增强机器创造力。

CreativeBench:通过自进化挑战评测与增强机器创造力:论文配图
图 2:我们的框架概述。 (左)我们介绍 CreativeBench,它是通过自动逆向工程和自玩管道构建的。 (中)我们使用统一的创造力得分来评估进化系统,创造力得分定义为质量(Pass@1)和新颖性(嵌入+n-gram距离)。 (右)根据我们的分析,我们提出了 EvoRePE 策略,以在推理时引导模型转向更具创造性的解决方案。