论文

用深度研究执行轨迹增强长上下文理解

Boosting Deepresearch and LongContext Ability with Self-Generated Deepresearch Rollouts Traces

模型训练合成数据

摘要

深度研究 (DR) 代理通过多轮搜索和访问与现实世界的 Web 环境进行交互,导致其上下文随着时间的推移而快速增长。我们观察到,即使在 DR 代理强化学习(DR-RL)之后,模型剩余预测误差的 61.6% 仍然可以归因于长上下文理解不足,包括长上下文幻觉和跨文档证据整合失败。这激励我们通过加强模型的长上下文能力来进一步突破 DR-RL 的瓶颈。然而,有效的长上下文训练需要的不仅仅是增加上下文长度。为了弥合数据差距,我们建议“DR轨迹转为 LongContext-QA (DR-to-Long)”。该方法重新利用了 DR-RL 轨迹,其中自然包含搜索历史、访问过的网页、证据片段和最终答案监督。然后,它用相应 URL 的完整内容替换每个轨迹中的紧凑片段和网页摘要,从而生成更长的多文档上下文,同时保留原始证据关系。在 DR-to-Long 的基础上,我们引入了 DLD (DR -> LongQA -> DR)-RL。 DLD-RL 首先执行一个简短的 DR-RL 阶段来收集采样轨迹,然后以零注释成本将其转换为 LongQA 实例。随后使用LongQA-RL对模型进行优化,以增强LongContext能力,随后使用完整的DR-RL来继续提高其DR能力。实验表明,DLD-RL 在三个 Deepresearch 基准测试中比标准 DR-RL 性能提高了 7.3%,在三个长上下文基准测试中性能提高了 13.5%。