论文

ReSum:经强化学习协同LLM推理与总结

ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

模型训练上下文与知识强化学习上下文工程RLVR

摘要

可验证奖励的强化学习 (RLVR) 是改进大型语言模型 (LLM) 中长期推理的核心技术。然而,现有的 RLVR 方法通常会鼓励不必要的长推理轨迹,这可能会降低推理一致性并耗尽可用的上下文预算。现有的长上下文组织方法通常依赖于外部机制来组织推理轨迹,而不是使模型能够管理其自身的推理轨迹。为了解决这一限制,我们提出了 ReSum,这是一种新颖的 RLVR 框架,使大语言模型能够通过自我总结来压缩和组织其推理轨迹。我们的试点研究表明,自总结通过降低词元级熵来稳定生成,并且引入“总结”短语可以显着减轻从不正确的采样轨迹前缀传播的错误。受这些发现的启发,ReSum 采用了一种摘要感知自适应采样轨迹机制,该机制可以对比评估自我摘要是否有利于正在进行的推理过程。具体来说,当模型自发触发自我总结时,ReSum 会屏蔽总结短语以创建对比分支;对于非摘要位置,它会随机注入短语以创建匹配的分支。我们进一步设计了一个摘要感知优势,以实现对比采样轨迹轨迹之间更细粒度的比较。大量实验表明,ReSum 平均提高了 4% 的性能,同时缩短了 18.6% 的部署长度。

ReSum:经强化学习协同LLM推理与总结:论文配图
图 1:试点研究。 (a):摘要短语附近的标记熵分布分析。 (b):从不同位置截断的错误推出的延续的平均准确度。