论文
UniCreative:通过无参考强化学习统一长篇逻辑与短篇灵光
UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement Learning
摘要
创意写作中的一项根本挑战在于调和两种内在张力:在长篇叙事中保持全局连贯,以及在短篇文本中保留局部表现力。长上下文生成需要显式的宏观规划,而短篇创意往往要求自发、无约束的表达。然而,现有对齐范式通常采用静态奖励信号,并高度依赖高质量监督数据,而这类数据成本高昂且难以规模化。为此,我们提出UniCreative,一个统一的无参考强化学习框架。我们首先提出AC-GenRM,一种自适应的约束感知奖励模型,可动态合成针对具体查询的评判标准,以提供细粒度的偏好判断。利用这些信号,我们提出ACPO,一种策略优化算法,在无需监督微调和真值参考的情况下,使模型在内容质量与结构范式两个维度上与人类偏好对齐。实证结果表明,AC-GenRM与专家评价高度一致,而ACPO在多样化写作任务上显著提升性能。关键的是,我们的分析揭示了一种涌现的元认知能力:模型学会自主区分需要严谨规划的任务与适合直接生成的任务,验证了直接对齐方法的有效性。
