论文

创造力的配方:大语言模型中的迭代生成与评估

Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

模型推理推理搜索与路径规划

摘要

生成模型常通过单一产物来评估,而人类创造力通常经由迭代生成、评估与打磨而涌现。本试点研究将FunSearch改造用于2024年Pillsbury烘焙大赛(Pillsbury Bake-Off)的食谱生成,并用基于TTCT的LLM评估把输出与人类基准对比,考察迭代搜索能否提升LLM创造力。在两个实验中,我们测试了迭代次数、生成器温度与循环内选择评分器的模型规模。结果表明,迭代生成-选择能产出创造力得分与人类基准相当的食谱,但仅增加迭代次数并不能提升创造力。循环内的评估器影响最大:更小的选择评分器在多数TTCT维度上产生显著更高的分数,而温度除独创性(originality)外影响有限。这些发现表明,评估器设计是主观创造性搜索中的一阶设计变量。

创造力的配方:大语言模型中的迭代生成与评估:论文配图
图1:概念框架,说明如何将FunSearch算法与基于TTCT的评估相结合,以评估所生成食谱产物的创造性。