论文
CreativeInstruct:可扩展教学 LLM 以平衡质量、创造力和多样性
CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity
摘要
虽然 后训练 提高了 大语言模型 (LLM) 的能力,但它通常会降低其输出多样性和创造力,从而对明确需要创造力的任务(例如故事生成)以及隐式需要创造力的任务(例如强化学习(RL))产生负面影响。相反,我们提出了 CreativeInstruct,这是一种可扩展的指令调整方法,通过学习注入特殊的 [StartCreativity] 跨度,使生成偏向于创造力,从而教导 LLM 平衡创造性的、类似基础模型的生成与训练后模型的质量。此外,我们引入了基于图编辑距离的结构多样性度量,它捕获了纯粹词汇和语义度量所遗漏的叙事水平变化。在叙事生成方面,CreativeInstruct 匹配或超过了多模型基线及其输出的提炼变体的多样性,而不会牺牲质量或在推理时需要多个模型。这些结果反映在我们的人工评估中,我们发现在 70.3% 的情况下,注释者认为 CreativeInstruct 世代比训练后的 LLM 世代更具创造力。我们还展示了创意模型作为 RL 基础的好处:与应用于训练后检查点的相同训练相比,应用于 CreativeInstruct 检查点的 GRPO 在 AMC 上提高了约 4%,在 MATH 上提高了约 5%。