论文
CreativeBench:通过自进化挑战评测与增强机器创造力
CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges
摘要
高质量预训练数据的饱和已将研究焦点转向能够持续生成新颖成果的进化系统,并促成了AlphaEvolve的成功。然而,此类系统的进展受到严谨定量评估缺失的制约。为应对这一挑战,我们提出CreativeBench,一个基于经典认知框架、用于评估代码生成中机器创造力的基准。该基准由CreativeBench-Combo和CreativeBench-Explore两个子集组成,通过利用逆向工程与自我对弈的自动化流程,分别针对组合型与探索型创造力。借助可执行代码,CreativeBench通过以质量与新颖度乘积定义的统一指标,客观地区分创造力与幻觉。我们对最先进模型的分析揭示了不同的行为:(1) 规模扩展显著提升组合型创造力,但对探索的收益递减;(2) 更大的模型表现出“随规模收敛”(convergence-by-scaling),变得更正确但发散性降低;(3) 推理能力主要受益于受限探索而非组合。最后,我们提出EvoRePE,一种即插即用的推理时引导策略,通过内化进化搜索模式持续增强机器创造力。
