论文

奖励创造力:面向故事创作强化学习的人类对齐生成式奖励模型

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

模型训练奖励建模与过程监督

摘要

虽然大语言模型(LLM)能生成流畅文本,但产出高质量创意故事仍有挑战。强化学习(RL)是有前景的方案,却面临两大关键障碍:为主观的故事质量设计可靠奖励信号,以及缓解训练不稳定。本文提出Reinforcement Learning for Creative Storytelling(RLCS)框架,系统性地应对这两个挑战。首先,我们开发了一个生成式奖励模型(GenRM),对故事偏好进行多维分析与显式推理,其训练方式是先在从强教师模型蒸馏出的含推理链示范上做监督微调,再在扩充的偏好数据上进行基于GRPO的精调。其次,我们引入基于熵的奖励塑形策略,动态地把学习优先级放在自信的错误与不确定的正确预测上,防止对已掌握模式的过拟合。实验表明,GenRM与人类创造力判断达到68%的一致率,RLCS在整体故事质量上显著超过包括Gemini-2.5-Pro在内的强基线。这项工作为在创意领域应用RL提供了实用管线,有效应对奖励建模与训练稳定性的双重挑战。

奖励创造力:面向故事创作强化学习的人类对齐生成式奖励模型
图1:RLCS 框架总览:(a) 基于无标注故事与人类反馈的数据构建;(b) 采用基于规则奖励的生成式奖励模型(Generative Reward Model, GenRM)训练;(c) 通过监督微调以及在 GenRM 指导下的强化学习进行 Story Model 训练。