论文

R2-Write:深度推理开放式写作的反思与修改

R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning

模型训练合成数据

摘要

虽然长思维链的深度推理在数学等可验证领域显着改善了 大语言模型,但其对于写作等开放式任务的有效性仍有待探索。在本文中,我们进行了系统的调查,揭示了现有的主流推理模型在开放式写作任务上取得的成果有限。我们的进一步分析表明,这些模型在开放式写作中缺乏深入的反思和修改模式,导致与数学推理任务相比,改进要小得多。为了解决这个限制,我们引入了 R2-Write:一个自动化框架,通过迭代的作家与评判交互,综合了高质量的思维轨迹,丰富了明确的反思和修订模式。为了防止冗余反射,我们设计了一种过程奖励机制,在强化学习过程中监督反思质量,从而提高性能和词元效率。跨多个创意写作和深度研究基准的广泛实验证明了显着的改进,验证了明确结合反思和修订模式可以解锁开放式写作任务的深度推理能力。