论文

面向长上下文推理的证据状态奖励

Evidence-State Rewards for Long-Context Reasoning

模型训练上下文与知识强化学习上下文工程记忆RLVRAgent记忆

摘要

长上下文推理要求模型定位、修订与综合分布在冗长输入中的证据。既有长上下文RL方法通常奖励最终答案或静态证据抽取——对中间动作如何改变模型证据状态几乎没有反馈。我们提出Maven——带可编辑证据记忆的强化学习框架。Maven定义答案条件化的证据状态价值并奖励动作级状态转换:添加动作由边际增益与事后贡献记分——链接动作由证据协同记分——丢弃动作由移除误导证据后答案支持的改善记分。这些奖励在GRPO中被分配到对应的动作跨度。跨Llama与Qwen模型在LongBench v2、LongReason与RULER上:Maven超越仅结果RL与证据识别基线——产生更充分的证据集与更低的干扰项保留。我们的结果表明长上下文RL受益于优化有状态的证据导航——而非一次性证据抽取。