论文
StoryAlign:评估和训练故事生成的奖励模型
StoryAlign: Evaluating and Training Reward Models for Story Generation
摘要
故事生成旨在自动生成连贯、结构化且引人入胜的叙述。尽管 大语言模型 (LLM) 具有显着先进的文本生成功能,但 LLM 生成的故事在复杂的叙事结构和人类偏好方面仍然与人类创作的作品有所不同。一个关键原因是缺乏对人类故事偏好的有效建模,这些偏好本质上是主观的且尚未得到充分探索。在这项工作中,我们系统地评估了人类故事偏好的建模,并引入了 StoryRMB,这是第一个评估故事偏好奖励模型的基准。 StoryRMB 包含1,133项高质量、经过人工验证的实例,每个实例都包含一个提示、一个选定的故事和三个被拒绝的故事。我们发现现有的奖励模型很难选择人类喜欢的故事,最好的模型仅达到 66.3% 的准确率。为了解决这一限制,我们在不同领域构建了大约 100,000对高质量故事偏好对,并开发了 StoryReward,这是一种在此数据集上训练的故事偏好的高级奖励模型。 StoryReward 在 StoryRMB 上实现了最先进的 (SoTA) 性能,优于更大的模型。我们还在下游测试时间扩展应用程序中采用 StoryReward 来进行 best-of-n (BoN) 故事选择,并发现它通常会选择更符合人类偏好的故事。我们将发布我们的数据集、模型和代码以促进未来的研究。相关代码和数据可参见https://github.com/THU-KEG/StoryReward。