论文
通过强化学习对故事产生建设性反馈
Generating Constructive Feedback on Stories via Reinforcement Learning
摘要
建设性的反馈对于创意作家提高讲故事的能力至关重要。由于接收人类专家的反馈通常成本高昂且耗时,大语言模型 (LLM) 提供了一种可扩展且高效的替代方案作为自动写作助手。尽管有潜力,但研究表明,LLM 生成的反馈通常是通用的,缺乏可操作性,并且无法确定哪个写作问题是最关键的。为了解决这些限制,我们提出了一种强化学习方法,引导 LLM 生成建设性反馈,而不需要 真值 反馈。我们使用群体相对策略优化(GRPO)和旨在建设性的新颖的多组件奖励函数来训练我们的模型:它优先考虑专门针对故事定制的反馈,有助于提高故事质量,并解决最关键的写作问题。在三个故事语料库的自动和人工评估中,我们的方法优于最先进的 LLM(包括 Gemini)和竞争基线。我们发现提供可行的建议是反馈建设性的主要驱动力。