论文
面向长上下文推理的证据增强策略优化与奖励共同演化
Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
摘要
虽然强化学习(RL)推动了 LLM 推理的进步,但结果奖励的稀疏性阻碍了其在长上下文场景中的应用。这一局限无法惩罚没有依据的“侥幸猜对”,使大海捞针式的证据检索这一关键过程在很大程度上处于无监督状态。为此,我们提出 EAPO(Evidence-Augmented Policy Optimization)。我们首先确立证据增强推理范式,并通过树结构证据采样验证:精确的证据提取是长上下文推理的决定性瓶颈。在这一洞见的指导下,EAPO 引入一种专门的 RL 算法,由奖励模型计算组相对证据奖励,为显式提升证据质量提供密集的过程监督。为了在整个训练过程中维持准确的监督,我们进一步纳入自适应奖励-策略共同演化机制。该机制利用与结果一致的 rollout 迭代地精炼奖励模型,锐化其判别能力,以确保精确的过程引导。在八个基准上的全面评估表明,与 SOTA 基线相比,EAPO 显著增强了长上下文推理性能。
