论文
LongTraceRL:使用 Rubric 奖励从搜索代理轨迹中学习长上下文推理
LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
摘要
长上下文推理仍然是 大语言模型 面临的主要挑战,它常常无法在大量分散注意力的内容中定位和整合关键信息。具有可验证奖励的强化学习(RLVR)已显示出完成这项任务的希望,但现有方法受到低混淆性干扰因素和稀疏、仅结果奖励信号的限制,无法监督中间推理步骤。为了解决这些问题,我们引入了 \textsc{LongTraceRL}。对于数据构建,我们通过知识图随机游走生成多跳问题,并利用搜索代理轨迹来构建\emph{分层干扰项}:代理阅读但未引用的文档(高混淆性)和出现在搜索结果中但从未打开的文档(低混淆性),产生的训练上下文比随机采样或一次性搜索构建的训练上下文更具挑战性。对于奖励设计,我们提出了 \emph{rubric 奖励},它使用每个推理链上的黄金实体作为细粒度的实体级流程监督。此标题奖励仅适用于最终答案正确的回答(仅限正面策略),区分正确回答中的推理质量并防止 奖励作弊。跨五个长上下文基准的三个推理 LLM (4B--30B) 的实验表明 \textsc{LongTraceRL} 始终优于强大的基线,并鼓励全面的、基于证据的推理。代码、数据集和模型可在 \href{https://github.com/THU-KEG/LongTraceRL}{https://github.com/THU-KEG/LongTraceRL} 获取。