论文

LiteResearcher:面向深度研究智能体的可扩展智能体强化学习训练框架

LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent

模型训练强化学习Agentic RL

摘要

强化学习(RL)已成为基于大语言模型(LLM)的智能体的一种强大训练范式。然而,面向深度研究的智能体强化学习扩展仍受制于两个相互耦合的挑战:人工构造的合成数据无法激发真实世界的搜索能力,而强化学习训练对真实世界搜索的依赖会引入不稳定性与高昂成本,这限制了 Agentic RL 的可扩展性。LiteResearcher 是一个使 Agentic RL 可扩展的训练框架:通过构建一个镜像真实世界搜索动态的轻量虚拟世界,我们实现了持续改进的训练配方,使一个微型搜索智能体能够超越大规模开源与商业模型(如 Tongyi DeepResearch 和 Claude-4.5 Sonnet)。具体而言,在 GAIA 与 Xbench 等常见基准上,我们的 LiteResearcher-4B 分别取得 71.3% 与 78.0% 的开源最优结果,表明可扩展的强化学习训练是深度研究智能体的关键使能因素。

LiteResearcher:面向深度研究智能体的可扩展智能体强化学习训练框架:论文配图
图 2:系统架构概览。 (a) 语料库扩展和 QA 综合:一种迭代数据引擎,还丰富了本地网页语料库,为零成本智能体强化学习训练提供稳定的本地工具。 (b) 强化课程学习:综合任务按复杂程度分级,以指导智能体完成渐进的训练阶段。这种强化学习循环利用本地工具交互,扩展研究能力,同时有效防止训练饱和。