论文

提高LLM短篇小说生成的多样性

Improving Diversity in LLM Short Story Generation

模型训练强化学习

摘要

大语言模型(LLM)可以生成准确的响应,但这些响应缺乏多样性。我们试图通过创造性短篇小说生成的任务来解决这个问题。借鉴既定的写作惯例和已知的LLM限制,我们的目标是体裁、语气、风格和命名实体的变化。为了促进这些维度的多样性,我们引入了 DivLM,这是一个由两个阶段组成的LLM后训练框架。首先,我们在创意写作语料库上继续执行预训练操作,并使用权重残差恢复指令跟踪能力。然后,我们应用强化学习和自定义的复合奖励函数,共同最大化目标叙述维度的多样性,同时保持响应质量。我们对两个LLM系列的实证结果表明,与其他方法相比,DivLM 的多样性指标平均提高了 9% 以上,同时保留了指令遵循、整体响应质量以及与人类输出的相似性。

提高LLM短篇小说生成的多样性的原论文方法或结果图
图 1:对于同一提示,Llama-3.1-8B-Instruct 跨代缺乏多样性(模式崩溃)。